中文

基于跨注意力特征融合的音频深度伪造检测与半真相局部化

声音 2026-05-29 v1 计算机视觉与模式识别 机器学习

摘要

音频深度伪造检测已作为二分类问题受到广泛关注,但部分操控语音(将短段合成语音拼接到整段真实语音中)构成更具挑战性和现实性的威胁。检测此类半真相音频不仅需要区分其与真实语音和完全伪造语音的差异,还需定位操控发生位置。我们提出了CAFNet,一个拥有576k参数的架构,同时解决上述两个任务:它进行三分类(真实、完全伪造或半真相)并对合成区域的时间边界进行回归,单次前向传播即可完成。CAFNet通过平行的深度可分离卷积分支采用跨注意力融合Mel频率系数(MFCC)、线性频率系数(LFCC)和色度短时傅里叶变换(Chroma-STFT)特征,随后通过双向长短期记忆网络(BiLSTM)回归头进行边界预测。在合并的多语言音频深度伪造检测语料库(MLADDC)T2+T3测试集上,CAFNet实现了92.71%的准确率和0.9910的宏观AUC,边界局部化平均绝对误差为0.075秒,中位数误差为0.052秒。在二分类检测中,它达到96.76%的准确率和3.20%的等误差率(EER),显著优于经微调的XLS-R 300M(78.31%)和AST 87M(93.03%),参数数量少500倍以上。跨数据集研究进一步表明,标准微调会在降低背部学习率的情况下仍然导致跨域表示的崩溃。

关键词

引用

@article{arxiv.2605.29531,
  title  = {Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion},
  author = {S. Sutharya and Remya K. Sasi},
  journal= {arXiv preprint arXiv:2605.29531},
  year   = {2026}
}

备注

13 pages, 5 figures, 11 tables