中文

利用说话人画像进行模仿音频检测

声音 2024-09-02 v1 音频与语音处理

摘要

虚假音频检测是一个新兴的活跃课题。越来越多的文献旨在检测虚假话语,这些话语大多由文本转语音(TTS)或语音转换(VC)生成。然而,针对模仿的对策仍是一个未被充分探索的领域。模仿是一种虚假类型,涉及模仿者复制目标说话人的特定特征和语音风格。与通常会留下数字痕迹或信号伪影的TTS和VC不同,模仿涉及真实人类产生完全自然的语音,使得模仿音频的检测成为一项具有挑战性的任务。因此,我们提出了一种将说话人画像整合到模仿音频检测过程中的新方法。说话人画像是模仿者难以准确模仿的固有特征,例如说话人的年龄、职业。我们旨在利用这些特征提取判别性信息以检测模仿音频。此外,目前没有可用于定量研究模仿影响的大型模仿语音语料库。为了填补这一空白,我们进一步设计了首个大规模、多说话人的中文模仿数据集,命名为模仿音频检测(IPAD),以推动社区在模仿音频检测方面的研究。我们在我们提出的数据集IPAD上评估了几种现有的虚假音频检测方法,证明了其必要性和面临的挑战。此外,我们的研究结果表明,结合说话人画像可以显著增强模型在检测模仿音频方面的性能。

关键词

引用

@article{arxiv.2408.17009,
  title  = {Utilizing Speaker Profiles for Impersonation Audio Detection},
  author = {Hao Gu and JiangYan Yi and Chenglong Wang and Yong Ren and Jianhua Tao and Xinrui Yan and Yujie Chen and Xiaohui Zhang},
  journal= {arXiv preprint arXiv:2408.17009},
  year   = {2024}
}

备注

Accepted by ACM MM2024