中文

多说话人对话音频深度伪造:分类、数据集与初步研究

声音 2026-02-03 v1 人工智能 音频与语音处理

摘要

文本到语音(TTS)技术的快速发展使音频深度伪造日益逼真且易于获取,引发重大的安全和信任问题。虽然现有研究主要关注检测单说话人音频深度伪造,但具有多说话人对话场景的恶意应用正在成为主要未被充分探讨的威胁。为填补这一差距,我们提出了多说话人对话音频深度伪造的概念分类,区分部分操纵(一个或多个说话人被操纵)和完全操纵(整个对话被合成)。作为第一步,我们引入了新的多说话人对话音频深度伪造数据集(Multi-speaker Conversational Audio Deepfakes Dataset, MsCADD),包含2,830个音频片段,包含真实和完全合成的两个说话人对话,使用VITS和SoundStorm-based NotebookLM模型模拟具有说话人性别变化和对话自发性的自然对话。MsCADD仅限于文本到语音(TTS)类型的深度伪造。我们对三个神经网络基准模型进行基准测试:LFCC-LCNN、RawNet2和Wav2Vec 2.0,并以F1分数、准确率、真阳率(TPR)和真阴率(TNR)为指标报告性能。结果表明,这些基准模型提供了有用的基准,但结果也显示,在各种对话动态下可靠检测合成语音的多说话人深度伪造研究存在显著差距。我们的数据集和基准为未来在对话场景下深入检测深度伪造提供了基础,这是研究中极少被探讨的领域,但也是可信信息在音频设置中面临的重大威胁。MsCADD数据集公开,以支持研究社区的可重复性和基准测试。

关键词

引用

@article{arxiv.2602.00295,
  title  = {Multi-Speaker Conversational Audio Deepfake: Taxonomy, Dataset and Pilot Study},
  author = {Alabi Ahmed and Vandana Janeja and Sanjay Purushotham},
  journal= {arXiv preprint arXiv:2602.00295},
  year   = {2026}
}

备注

This work was presented at the 2025 IEEE International Conference on Data Mining, ICDM 2025, November 12-15,2025, Washington DC, USA