中文

单说话人与多说话人克隆语音检测:从感知特征到习得特征

声音 2023-09-28 v2 计算与语言 音频与语音处理

摘要

合成语音克隆技术近年来取得显著进展,引发了一系列潜在危害。从中小规模到大规模的金融欺诈,再到虚假信息活动,对可靠方法以区分真实语音与合成语音的需求已迫在眉睫。我们描述了三种用于区分真实语音与旨在冒充特定人物的克隆语音的技术。这三种方法在特征提取阶段有所不同:低维感知特征具有高可解释性但精度较低,通用频谱特征居中,端到端习得特征可解释性较低但精度较高。我们展示了这些方法在单说话人语音训练与多说话人语音训练时的有效性。习得特征的一致等错误率介于 0% 与 4% 之间,并且对对抗性清洗具有相当的鲁棒性。

关键词

引用

@article{arxiv.2307.07683,
  title  = {Single and Multi-Speaker Cloned Voice Detection: From Perceptual to Learned Features},
  author = {Sarah Barrington and Romit Barua and Gautham Koorma and Hany Farid},
  journal= {arXiv preprint arXiv:2307.07683},
  year   = {2023}
}

备注

S. Barrington, R. Barua, G. Koorma, and Hany Farid. Single and Multi-Speaker Cloned Voice Detection: From Perceptual to Learned Features. Workshop on Image Forensics and Security, Nuremberg, Germany, 2023