Uppsats

Informationsextrahering från långa PDF-dokument för effektivt frågebesvarande : En jämförande studie av system för informationsutvinning och frågebesvarande över finansiella dokument med stora språkmodeller

Kandidat-uppsats

KTH/Hälsoinformatik och logistik

Publicerad: 2026

Språk: Svenska

Sammanfattning

Denna rapport undersöker hur stora språkmodeller kan användas för att automatisera informationsextraktion ur finansiella PDF-dokument. Finansiella dokument är ofta långa och komplexa, vilket gör manuell extrahering tidskrävande och svår att skala. Syftet är att ta fram och utvärdera ett sammanfattningsbaserat system samt jämföra dess prestanda mot ett Retrieval-Augmented Generation-system (RAG) för frågebesvarande. Det utvecklade sammanfattningsbaserade systemet består av fyra steg: textextrahering, segmentering, frågefokuserad och hierarkisk sammanfattning, och till sist frågebesvarande. Parametrarna som undersöks i arbetet är två PDF-läsare, tre segmentstorlekar samt två sammanfattningslängder. Utvärderingen genomfördes med måtten Exact Match och F1-värde. Den valda konfigurationen för det utvecklade systemet uppnådde ett genomsnittligt Exact Match-värde på 0,81 och genomsnittligt F1-värde på 0,85 över tre körningar. Den testade RAG-konfigurationen uppnådde motsvarande värden på 0,76 respektive 0,81. Resultaten indikerar att det utvecklade systemet kan utgöra ett relevant alternativ till retrieval-baserade strategier för frågebesvarande över finansiella dokument.

Utforska vidare

Liknande uppsatser

Uppsatser med liknande ämnen och nyckelord.