中文

可解释的时间类激活表示用于音频欺骗检测

声音 2025-07-28 v2 密码学与安全 音频与语音处理

摘要

解释音频欺骗检测模型做出的决策对于建立对检测结果的信任至关重要。然而,当前关于检测模型可解释性的研究仅限于将XAI工具应用于训练后的模型。在本文中,我们利用wav2vec 2.0模型和注意力机制的话语级特征,将可解释性直接集成到模型架构中,从而增强决策过程的透明度。具体来说,我们提出了一种类激活表示,用于定位对检测有贡献的判别性帧。此外,我们证明,基于欺骗类型的多标签训练(而非二元标签如真实和欺骗)使模型能够学习不同攻击的独特特征,显著提高了检测性能。我们的模型取得了最先进的结果,在ASVspoof2019-LA数据集上实现了0.51%的等错误率(EER)和0.0165的最小t-DCF。

关键词

引用

@article{arxiv.2406.08825,
  title  = {Interpretable Temporal Class Activation Representation for Audio Spoofing Detection},
  author = {Menglu Li and Xiao-Ping Zhang},
  journal= {arXiv preprint arXiv:2406.08825},
  year   = {2025}
}

备注

5 pages, 2 figures, Accepted to Interspeech2024