中文

跨域音频深度伪造检测:数据集与分析

声音 2024-09-23 v2 人工智能 音频与语音处理

摘要

音频深度伪造检测(ADD)对于防止可能侵犯个人权利和隐私的合成语音的滥用至关重要。最近的零样本文本转语音(TTS)模型由于能够通过单次语音克隆声音而带来更高的风险。然而,现有的ADD数据集已经过时,导致检测模型的泛化能力欠佳。在本文中,我们构建了一个新的跨域ADD数据集,包含超过300小时的语音数据,这些数据由五个先进的零样本TTS模型生成。为了模拟真实场景,我们采用了不同的攻击方法和来自不同数据集的音频提示。实验表明,通过新颖的攻击增强训练,Wav2Vec2-large和Whisper-medium模型分别达到了4.1%和6.5%的等错误率。此外,我们通过仅使用一分钟的目标域数据进行微调,展示了模型出色的少样本ADD能力。然而,神经编解码压缩器极大地影响了检测精度,需要进一步研究。

关键词

引用

@article{arxiv.2404.04904,
  title  = {Cross-Domain Audio Deepfake Detection: Dataset and Analysis},
  author = {Yuang Li and Min Zhang and Mengxin Ren and Miaomiao Ma and Daimeng Wei and Hao Yang},
  journal= {arXiv preprint arXiv:2404.04904},
  year   = {2024}
}