利用说话人画像进行模仿音频检测
声音
2024-09-02 v1 音频与语音处理
摘要
虚假音频检测是一个新兴的活跃课题。越来越多的文献旨在检测虚假话语,这些话语大多由文本转语音(TTS)或语音转换(VC)生成。然而,针对模仿的对策仍是一个未被充分探索的领域。模仿是一种虚假类型,涉及模仿者复制目标说话人的特定特征和语音风格。与通常会留下数字痕迹或信号伪影的TTS和VC不同,模仿涉及真实人类产生完全自然的语音,使得模仿音频的检测成为一项具有挑战性的任务。因此,我们提出了一种将说话人画像整合到模仿音频检测过程中的新方法。说话人画像是模仿者难以准确模仿的固有特征,例如说话人的年龄、职业。我们旨在利用这些特征提取判别性信息以检测模仿音频。此外,目前没有可用于定量研究模仿影响的大型模仿语音语料库。为了填补这一空白,我们进一步设计了首个大规模、多说话人的中文模仿数据集,命名为模仿音频检测(IPAD),以推动社区在模仿音频检测方面的研究。我们在我们提出的数据集IPAD上评估了几种现有的虚假音频检测方法,证明了其必要性和面临的挑战。此外,我们的研究结果表明,结合说话人画像可以显著增强模型在检测模仿音频方面的性能。
引用
@article{arxiv.2408.17009,
title = {Utilizing Speaker Profiles for Impersonation Audio Detection},
author = {Hao Gu and JiangYan Yi and Chenglong Wang and Yong Ren and Jianhua Tao and Xinrui Yan and Yujie Chen and Xiaohui Zhang},
journal= {arXiv preprint arXiv:2408.17009},
year = {2024}
}
备注
Accepted by ACM MM2024