通过小波提示微调与多模型集成的防欺骗感知说话人确认
音频与语音处理
2026-01-27 v1 声音
摘要
本文描述了提交至 WildSpoof 2026 挑战赛 SASV 赛道的 UZH-CL 系统。该挑战赛侧重于通过要求同时验证说话人身份和音频真实性,实现对生成式欺骗攻击的综合防御。我们提出了一种级联的防欺骗感知说话人确认框架,该框架集成了小波提示微调的 XLSR-AASIST 对抗措施与多模型集成。ASV 组件利用 ResNet34、ResNet293 和 WavLM-ECAPA-TDNN 架构,并采用 Z 分数归一化后接分数平均。该系统在 VoxCeleb2 和 SpoofCeleb 上训练,获得了 0.2017 的 Macro a-DCF 和 2.08% 的 SASV EER。虽然该系统在域内数据上的欺骗检测 EER 达到了 0.16%,但在未见过的数据集(如 ASVspoof5)上的结果凸显了跨域泛化的关键挑战。
引用
@article{arxiv.2601.17557,
title = {Spoofing-Aware Speaker Verification via Wavelet Prompt Tuning and Multi-Model Ensembles},
author = {Aref Farhadipour and Ming Jin and Valeriia Vyshnevetska and Xiyang Li and Elisa Pellegrino and Srikanth Madikeri},
journal= {arXiv preprint arXiv:2601.17557},
year = {2026}
}
备注
System description of the T03 team in the WildSpoof Challenge at ICASSP 2026