中文

基于证据深度学习的 FADEL:不确定性感知假音频检测

音频与语音处理 2025-04-23 v1 人工智能

摘要

最近,随着语音合成和语音转换技术的进步,自动说话人验证(ASV)系统面临欺骗攻击的威胁增加,导致假音频检测受到广泛关注。一个关键挑战在于将模型推广到检测未见的、离群分布(OOD)攻击。虽然已有方法在某些方面表现突出,但由于使用 softmax 进行分类,本质上存在过度自信问题,难以可靠地预测面对不可预见的欺骗尝试时的结果。为此,我们提出一种新框架,称为基于证据学习的假音频检测(FADEL)。通过对类别概率建模为 Dirichlet 分布,FADEL 将模型不确定性纳入预测,从而在 OOD 场景中实现更稳健的性能。在 ASVspoof2019 逻辑访问(LA)和 ASVspoof2021 LA 数据集上的实验结果表明,所提方法显著改进了基线模型的性能。进一步,我们通过分析不同欺骗算法中平均不确定性与相等错误率(EER)之间的强相关性,证明了不确定性估计的有效性。

关键词

引用

@article{arxiv.2504.15663,
  title  = {FADEL: Uncertainty-aware Fake Audio Detection with Evidential Deep Learning},
  author = {Ju Yeon Kang and Ji Won Yoon and Semin Kim and Min Hyun Han and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2504.15663},
  year   = {2025}
}

备注

Accepted at ICASSP 2025