Uppsats

Representationsvektorers påverkan på videorekommendationssystem : Poolade multimodala embeddings med CLIP

Kandidat-uppsats

KTH/Hälsoinformatik och logistik

Publicerad: 2026

Språk: Svenska

Sammanfattning

Generering av multimodala embeddingvektorer är beräkningsmässigt kostsam, särskilt vid analys av videoinnehåll. I detta arbete undersöks hur sammansatta multimodala embeddings påverkar rekommendationskvalitet, resursåtgång och robusthet jämfört med individuella embeddings. En pipeline utvecklades där individuella embeddings först genererades, därefter aggregerades genom medelvärdesammansättning av embeddings från videor som tillhör tråd. De resulterande representationerna utvärderades därefter genom en rankingbaserad offline-analys med etablerade utvärderingsmått för rekommendationssystem. Resultaten visar att sammansatta embeddings uppnår i genomsnitt 31% högre semantisk överensstämmelse än individuella embeddings, vilket indikerar förbättrad rangordning av relevanta videor. Vidare reducerar pooling antalet embeddings som behöver lagras och jämföras, vilket minskar både lagringsbehov och beräkningskostnad och därmed förbättrar systemets skalbarhet. Resultaten visar även att sammansatta embeddings ger stabilare rekommendationer i dataglesa och coldstart-scenarier, där historiska användardata saknas. Sammanfattningsvis indikerar studien att sammansatta multimodala embeddings är en resurseffektiv metod som kombinerar förbättrad rekommendationskvalitet med ökad robusthet i praktiska tillämpningar. Framtida arbete kan undersöka alternativa aggrigerande strategier, såsom viktad aggrigering eller mer avancerade representationsmodeller, för att ytterligare bevara semantiska variationer inom tematiska trådar.

Information

Lärosäte / institution
KTH/Hälsoinformatik och logistik
Publiceringsdatum
2026
Uppsatstyp
Kandidat-uppsats
Språk
Svenska

Utforska vidare

Liknande uppsatser

Uppsatser med liknande ämnen och nyckelord.