中文

AASIST3:结合 SSL 特征与额外正则化的 KAN 增强型 AASIST 语音深度伪造检测(面向 ASVspoof 2024 挑战赛)

声音 2026-05-19 v2 人工智能 音频与语音处理

摘要

自动说话人确认 (ASV) 系统根据说话人的声音特征识别身份,在金融交易中的用户认证、智能设备的专属访问控制以及法医欺诈检测等众多场景中具有广泛应用。然而,深度学习算法的进步使得通过文本转语音 (TTS) 和语音转换 (VC) 系统生成合成音频成为可能,令 ASV 系统面临潜在漏洞。为应对此问题,我们提出了一种名为 AASIST3 的新颖架构。通过用 Kolmogorov-Arnold networks、额外的层、编码器和预加重技术增强现有的 AASIST 框架,AASIST3 实现了两倍以上的性能提升。它在封闭条件下取得了 0.5357 的 minDCF 结果,在开放条件下取得了 0.1414 的结果,显著增强了对合成语音的检测能力并提升了 ASV 的安全性。\textbf{该模型的新版本已在 \href{https://huggingface.co/lab260/Spectra-AASIST3}{\underline{HuggingFace (2026)}} 公开发布}

关键词

引用

@article{arxiv.2408.17352,
  title  = {AASIST3: KAN-Enhanced AASIST Speech Deepfake Detection using SSL Features and Additional Regularization for the ASVspoof 2024 Challenge},
  author = {Kirill Borodin and Vasiliy Kudryavtsev and Dmitrii Korzh and Alexey Efimenko and Grach Mkrtchian and Mikhail Gorodnichev and Oleg Y. Rogov},
  journal= {arXiv preprint arXiv:2408.17352},
  year   = {2026}
}

备注

8 pages, 2 figures, 2 tables. Accepted paper at the ASVspoof 2024 (the 25th Interspeech Conference)