中文

AFSS:面向伪影的自合成方法以缓解音频深度伪造检测中的偏差

声音 2026-03-31 v1 人工智能 音频与语音处理

摘要

生成模型的快速发展使得高度逼真的音频深度伪造成为可能,然而当前检测器存在一个关键的偏差问题,导致在未见数据集上泛化能力差。本文提出伪影聚焦自合成(AFSS)方法,旨在通过两种机制缓解该偏差:从真实音频生成伪伪造样本的自转换和自重建。AFSS的核心洞见在于强制相同说话人约束,确保真实样本与伪伪造样本共享相同的说话人身份和语义内容。这迫使检测器 exclusively 关注生成伪影而非无关混淆因素。此外,我们引入了一种可学习的重加权损失,在训练过程中动态强调合成样本。在7个数据集上的广泛实验表明,AFSS实现了最先进的性能,平均等错误率(EER)为5.45%,其中在WaveFake上显著降低至1.23%,在In-the-Wild上降低至2.70%,同时消除了对预收集伪造数据集的依赖。我们的代码在https://github.com/NguyenLeHaiSonGit/AFSS上公开可用。

关键词

引用

@article{arxiv.2603.26856,
  title  = {AFSS: Artifact-Focused Self-Synthesis for Mitigating Bias in Audio Deepfake Detection},
  author = {Hai-Son Nguyen-Le and Hung-Cuong Nguyen-Thanh and Nhien-An Le-Khac and Dinh-Thuc Nguyen and Hong-Hanh Nguyen-Le},
  journal= {arXiv preprint arXiv:2603.26856},
  year   = {2026}
}

备注

Accepted at International Joint Conference on Neural Networks 2026