Uppsats
Effektivare informationssökning i ostrukturerad textdata med AI
Kandidat-uppsats
Stockholms universitet/Institutionen för data- och systemvetenskap
Publicerad: 2025
Språk: Svenska
Sammanfattning
Introduktion: Denna studie undersöker hur moderna metoder inom Artificiell Intelligens (AI) kan användas för att effektivisera informationssökning i ostrukturerad textdata. Studien fokuserar på utmaningen att effektivt söka efter och hitta relevant information i enkäten Kollektivtrafikbarometern (Kollbar) från Trafikförvaltningen, Region Stockholm. Målet är att identifiera hur AI kan hjälpa till att fånga upp värdefulla insikter från resenärer som kan stödja utvecklingen av kollektivtrafiken. Forskningsfråga: Studiens huvudfråga är: Hur effektiva är två moderna AI-metoder för att hitta information i ostrukturerad textdata från Kollbarenkäten? En underfråga har också undersökts: Hur kan en Large Language Model (LLM) användas som ett kompletterande steg för att ytterligare förbättra resultaten hos den mest träffsäkra metoden? Metod: Ett kontrollerat experiment genomfördes där två AI-baserade sökmetoder jämfördes: Vector Search och Azure AI Search Hybrid. Utvärderingen gjordes med följande prestandamått: Area Under the Curve (AUC), Precision-Recall Area Under the Curve (PR AUC), Precision@k, Recall@k och F1-score@k. Därefter utfördes ett ytterligare experiment med en LLM för att förbättra resultaten genom filtrering. Resultat: Studien visar att AI Search Hybrid i genomsnitt presterar bättre än Vector Search, dock är skillnaderna mellan metoderna ofta små. Val av tröskel visar att ett lämpligt tröskelvärde kan filtrera bort många irrelevanta svar utan att förlora för många relevanta. Vidare förbättrades träffsäkerheten ytterligare när en LLM integrerades i sökprocessen. Diskussion: Resultaten visar att kombinationen av AI Search och LLM kan vara ett kraftfullt verktyg för att analysera ostrukturerad textdata. Träffsäkerheten förbättras genom att först filtrera med AI Search och därefter låta en LLM göra en mer detaljerad bedömning. Att skicka all data direkt till LLM skulle möjligtvis ge bättre resultat med färre bortfall, men det innebär högre kostnader, lägre svarstider och större miljöpåverkan. Det är därför viktigt att hitta en balans mellan att fånga upp så många relevanta svar som möjligt och att använda resurser på ett effektivt sätt. För framtida forskningar föreslås att metoderna testas på andra dataset samt med mer avancerade och varierande sökfrågor samt att undersöka effekten av olika formuleringar i promptar.
Information
- Författare
- Fredriksson, Malin, Gonzalez Carrasco, Cecilia
- Lärosäte / institution
- Stockholms universitet/Institutionen för data- och systemvetenskap
- Publiceringsdatum
- 2025
- Uppsatstyp
- Kandidat-uppsats
- Språk
- Svenska
Utforska vidare
Liknande uppsatser
Uppsatser med liknande ämnen och nyckelord.
Master-uppsats, Försvarshögskolan
Hellqvist, Theodor
Publicerad: 2026
Kandidat-uppsats, Örebro universitet/Institutionen för humaniora, utbildnings- och samhällsvetenskap
Blomdahl, Melissa, Gustafsson, Alice
Publicerad: 2026
Kandidat-uppsats, Jönköping University/Högskolan för lärande och kommunikation
Strand, Albin, Asela, Rebecka
Publicerad: 2026
Kandidat-uppsats, KTH/Hälsoinformatik och logistik
Abdulnoor, Tia, Bygde, Thea
Publicerad: 2026
Kandidat-uppsats, Högskolan i Skövde/Institutionen för handel och företagande
Kling, Ellen, Rakh, Shilan
Publicerad: 2026
Kandidat-uppsats, Högskolan i Gävle/Företagsekonomi
Cucarano Averstad, Elliott, Hoc, Izabella
Publicerad: 2026