Sammanfattning

Sammanfattning Röstbaserad autentisering används i allt större utsträckning inom finansiella system och andra säkerhetskritiska miljöer. Utvecklingen har lett till att systemen blivit mer sårbara för spoofing-attacker, särskilt sådana som bygger på syntetiskt eller manipulerat tal. Samtidigt som teknik för syntetiskt tal utvecklas, utgör attacker ett hot mot tillförlitligheten på automatiska talverifieringssystem (ASV). Mot denna bakgrund undersöker denna studie hur effektivt olika djupinlärningsbaserade modeller kan användas för att upptäcka spoofing-attacker. Studien genomför en jämförande analys av fyra olika arkitekturer med hjälp av ASVspoof 2019 Logical Access-datasetet. De modeller som ingår i utvärderingen är ett VGG-inspirerat konvolutionellt neuralt nätverk (CNN), Long Short-Term Memory (LSTM), Gated Recurrent Unit (GRU) samt bidirektionell GRU (BiGRU). Modellerna valdes utifrån dektekteringsprestanda med hänsyn till beräkningskrav och praktisk användbarhet. För att bedöma modellernas prestanda används flera etablerade utvärderingsmått, däribland Equal Error Rate (EER), minimum normaliserad tandem Detection Cost Function (t-DCF), noggrannhet, precision, recall, F1-poäng och AUC. Confusion matrix analyseras också för att ge en mer detaljerad bild av modellernas felbeteende. Resultaten visar att de rekurrenta arkitekturerna presterar bättre än den konvolutionella baslinjemodellen. BiGRU uppvisar bäst resultat, med de lägsta värdena för EER och t-DCF, samtidigt som den uppvisar hög noggrannhet och F1-poäng. Detta indikerar att modellen på ett effektivt sätt kan skilja mellan äkta och manipulerade röstprover och samtidigt upprätthålla en god balans mellan säkerhet och användbarhet. Även den CNN-baserade modellen uppvisar konkurrenskraftiga resultat, medan LSTM-modellen visar tecken på begränsad generaliseringsförmåga trots hög träningsnoggrannhet, vilket tyder på överanpassning. Sammanfattningsvis visar studien att GRU-baserade arkitekturer, och i synnerhet BiGRU, är lämpad för robust och kostnadseffektiv spoofing-detektion i röstbaserade autentiseringssystem. De erbjuder balans mellan dektekteringsprestandan i relation till beräkningskraven, vilket gör dem effektiva för praktisk implementering.

Utforska vidare

Liknande uppsatser

Uppsatser med liknande ämnen och nyckelord.