中文

面向欺骗稳健的说话人验证:说话人与欺骗检测器的联合优化

音频与语音处理 2026-03-31 v2

摘要

欺骗稳健说话人验证 (SASV) 将说话人和欺骗检测任务组合在一起,在对抗性环境下对说话人进行身份验证。许多 SASV 系统依赖于在嵌入、评分或决策水平上基于独立训练子系统的融合说话人和欺骗线索。在本研究中,我们保持类似的模块化结构,通过可训练的后端分类器集成其输出。特别是,我们探讨了各种方法,以作为训练目标直接优化最近提出的 SASV 性能指标 (a-DCF)。我们在 ASVspoof 5 数据集上的实验表明有两个重要发现:(i) 非线性得分融合在 a-DCF 上一致优于线性融合;(ii) 结合用于说话人检测的加权余弦计分与用于欺骗检测的 SSL-AASIST 可实现最佳性能,将最小 a-DCF 降至 0.196,SPF-EER 降至 7.6%。这些贡献凸显了模块化设计、校准集成和任务对齐优化在推动稳健且可解释的 SASV 系统方面的重要性。

关键词

引用

@article{arxiv.2510.01818,
  title  = {Joint Optimization of Speaker and Spoof Detectors for Spoofing-Robust Automatic Speaker Verification},
  author = {Oğuzhan Kurnaz and Jagabandhu Mishra and Tomi H. Kinnunen and Cemal Hanilçi},
  journal= {arXiv preprint arXiv:2510.01818},
  year   = {2026}
}

备注

submitted to IEEE/ACM Transactions on Audio, Speech and Language Processing