Uppsats

Efterkorrigering av OCR-genererad text från svenska historiska dokument med hjälp av språkmodeller: En utvärderande studie : Analys av svenska historiska texter med hjälp av OCR, NLP och LLM i samverkan: En modern metod för att tolka det förflutna

Kandidat-uppsats

KTH/Hälsoinformatik och logistik

Publicerad: 2025

Språk: Svenska

Sammanfattning

Digitalisering av svenska historiska texter med optisk teckenigenkänning (OCR) spelar en viktig roll för bevarandet av kulturarvet, men processen resulterar ofta i texter med hög felfrekvens på grund av dokumentens ålder, skadade papper och föråldrade typsnitt. Dessa OCR-fel skapar en "brusig" och otillförlitlig digital version som begränsar texternas användbarhet för forskning. Denna rapport utvärderar potentialen hos stora språkmodeller (LLM) som ett automatiskt efterkorrigeringssteg för att systematiskt reparera dessa OCR-genererade fel. Genom att tillämpa en integrerad pipeline där LLM-modeller analyserar den initiala OCR-texten, kan felaktigheter korrigeras, meningar förtydligas och ord förutsägas utifrån språklig och historisk kontext. Studien kvantifierar i vilken utsträckning denna metod kan öka precisionen i de digitaliserade texterna och analyserar styrkorna och svagheterna hos olika språkmodeller för denna specifika uppgift. Resultaten visar att en metod som kombinerar OCR med efterkorrigering via språkmodeller ger betydligt mer tillförlitliga och användbara texter än vad som kan uppnås med enbart OCR, vilket i sin tur underlättar och förbättrar förutsättningarna för vidare historisk forskning.

Utforska vidare

Liknande uppsatser

Uppsatser med liknande ämnen och nyckelord.