中文

RPRA-ADD:伪造痕迹增强驱动的音频深度伪造检测

声音 2025-06-03 v1 音频与语音处理

摘要

现有的音频深度伪造检测方法已展现出一定的有效性。然而,它们在泛化到新的伪造技术和不断演变的攻击模式方面仍面临挑战。这种局限性主要源于模型严重依赖训练数据的分布,未能学习到能捕捉伪造本质特征的决策边界。此外,仅依赖分类损失难以捕捉真实与伪造音频之间的内在差异。在本文中,我们提出了 RPRA-ADD,这是一个基于集成重建-感知-强化-注意力网络、由伪造痕迹增强驱动的鲁棒音频深度伪造检测框架。首先,我们提出了全局-局部伪造感知 (GLFP) 模块,用于增强对伪造痕迹的声学感知能力。为了显著强化真实与伪造音频之间的特征空间分布差异,设计了多阶段分散增强损失 (MDEL),其在多阶段特征空间中实施分散策略。此外,为了增强对伪造痕迹的特征感知,引入了伪造痕迹聚焦注意力 (FTFA) 机制,以根据重建差异矩阵动态调整注意力权重。可视化实验不仅表明 FTFA 提高了对语音片段的注意力,还增强了泛化能力。实验结果表明,所提出的方法在包括 ASVspoof2019、ASVspoof2021、CodecFake 和 FakeSound 在内的 4 个基准数据集上取得了 SOTA 性能,性能提升超过 20%。此外,在跨语音、声音和歌唱的严格 3*3 跨域评估中,它优于现有方法,展示了在多样化音频领域之间强大的泛化能力。

关键词

引用

@article{arxiv.2506.00375,
  title  = {RPRA-ADD: Forgery Trace Enhancement-Driven Audio Deepfake Detection},
  author = {Ruibo Fu and Xiaopeng Wang and Zhengqi Wen and Jianhua Tao and Yuankun Xie and Zhiyong Wang and Chunyu Qiang and Xuefei Liu and Cunhang Fan and Chenxing Li and Guanjun Li},
  journal= {arXiv preprint arXiv:2506.00375},
  year   = {2025}
}