HierCon:面向音频深度伪造检测的层次化对比注意力
声音
2026-02-03 v1 人工智能
音频与语音处理
摘要
由现代 TTS 与语音转换系统生成的音频深度伪造日益难以区分于真实语音,已引发安全与线上信任方面的严重风险。虽然领先的自监督模型提供了丰富的多层表征,但现有检测器独立处理各层,忽略了识别合成伪影所必需的时序与层次依赖。我们提出 HierCon,一种结合层次化注意力与基于边际的对比学习框架,建模跨时序帧、相邻层次及层次组之间的依赖,同时鼓励领域不变性表征。经评估于 ASVspoof 2021 DF 与 In-the-Wild 数据集,本方法实现了最先进的性能(分别为 1.93% 与 6.87% EER),相较于独立层次加权提升了 36.6% 与 22.5%。结果及注意力可视化表明,层次化建模提升了对跨域生成技术与录音环境的泛化能力。
引用
@article{arxiv.2602.01032,
title = {HierCon: Hierarchical Contrastive Attention for Audio Deepfake Detection},
author = {Zhili Nicholas Liang and Soyeon Caren Han and Qizhou Wang and Christopher Leckie},
journal= {arXiv preprint arXiv:2602.01032},
year = {2026}
}
备注
Proceedings of The Web Conference 2026 (WWW'26), short track