Uppsats

Effektivare informationssökning i ostrukturerad textdata med AI

Kandidat-uppsats

Stockholms universitet/Institutionen för data- och systemvetenskap

Publicerad: 2025

Språk: Svenska

Sammanfattning

Introduktion: Denna studie undersöker hur moderna metoder inom Artificiell Intelligens (AI) kan användas för att effektivisera informationssökning i ostrukturerad textdata. Studien fokuserar på utmaningen att effektivt söka efter och hitta relevant information i enkäten Kollektivtrafikbarometern (Kollbar) från Trafikförvaltningen, Region Stockholm. Målet är att identifiera hur AI kan hjälpa till att fånga upp värdefulla insikter från resenärer som kan stödja utvecklingen av kollektivtrafiken. Forskningsfråga: Studiens huvudfråga är: Hur effektiva är två moderna AI-metoder för att hitta information i ostrukturerad textdata från Kollbarenkäten? En underfråga har också undersökts: Hur kan en Large Language Model (LLM) användas som ett kompletterande steg för att ytterligare förbättra resultaten hos den mest träffsäkra metoden? Metod: Ett kontrollerat experiment genomfördes där två AI-baserade sökmetoder jämfördes: Vector Search och Azure AI Search Hybrid. Utvärderingen gjordes med följande prestandamått: Area Under the Curve (AUC), Precision-Recall Area Under the Curve (PR AUC), Precision@k, Recall@k och F1-score@k. Därefter utfördes ett ytterligare experiment med en LLM för att förbättra resultaten genom filtrering. Resultat: Studien visar att AI Search Hybrid i genomsnitt presterar bättre än Vector Search, dock är skillnaderna mellan metoderna ofta små. Val av tröskel visar att ett lämpligt tröskelvärde kan filtrera bort många irrelevanta svar utan att förlora för många relevanta. Vidare förbättrades träffsäkerheten ytterligare när en LLM integrerades i sökprocessen. Diskussion: Resultaten visar att kombinationen av AI Search och LLM kan vara ett kraftfullt verktyg för att analysera ostrukturerad textdata. Träffsäkerheten förbättras genom att först filtrera med AI Search och därefter låta en LLM göra en mer detaljerad bedömning. Att skicka all data direkt till LLM skulle möjligtvis ge bättre resultat med färre bortfall, men det innebär högre kostnader, lägre svarstider och större miljöpåverkan. Det är därför viktigt att hitta en balans mellan att fånga upp så många relevanta svar som möjligt och att använda resurser på ett effektivt sätt. För framtida forskningar föreslås att metoderna testas på andra dataset samt med mer avancerade och varierande sökfrågor samt att undersöka effekten av olika formuleringar i promptar.

Utforska vidare

Liknande uppsatser

Uppsatser med liknande ämnen och nyckelord.