中文

我能听见你:面向深度伪造音频检测的选择性鲁棒训练

声音 2024-11-04 v1 人工智能 音频与语音处理

摘要

人工智能生成语音的最新进展加剧了检测深度伪造音频的挑战,带来了诈骗和虚假信息传播的风险。为解决此问题,我们建立了迄今最大的公开语音数据集,名为DeepFakeVox-HQ,包含130万个样本,其中包括来自14个不同来源的27万个高质量深度伪造样本。尽管先前报告了高准确率,但现有的深度伪造语音检测器在我们多样收集的数据集上表现挣扎,并且在现实的损坏和对抗攻击下,其检测成功率进一步下降。我们对增强模型鲁棒性的因素进行了全面研究,并表明纳入多样化的语音增强集是有益的。此外,我们发现最佳的检测模型通常依赖于高频特征,这些特征对人类来说是不可感知的,并且容易被攻击者操纵。为解决此问题,我们提出了F-SAT:频率选择性对抗训练方法,该方法专注于高频成分。实证结果表明,使用我们的训练数据集将基线模型性能(未经鲁棒训练)提升了33%,而我们的鲁棒训练在干净样本上进一步将准确率提高了7.7%,在损坏和受攻击样本上提高了29.3%,超越了最先进的RawNet3模型。

关键词

引用

@article{arxiv.2411.00121,
  title  = {I Can Hear You: Selective Robust Training for Deepfake Audio Detection},
  author = {Zirui Zhang and Wei Hao and Aroon Sankoh and William Lin and Emanuel Mendiola-Ortiz and Junfeng Yang and Chengzhi Mao},
  journal= {arXiv preprint arXiv:2411.00121},
  year   = {2024}
}