一种语音真实性评估的新方法
声音
2024-02-12 v1 人工智能
音频与语音处理
摘要
语音伪造主要由近期文本到语音(TTS)合成技术的进步所推动,构成了重大的社会挑战。目前,普遍的假设是未篡改的人类语音可被视为真实的,而伪造语音则来自 TTS 合成。我们认为这种二元区分过于简化。例如,篡改的播放速度可用于恶意目的,如“醉酒的南希·佩洛西”事件。类似地,音频片段的编辑可以是合乎伦理的,例如在新闻报道或播客中为了简洁或摘要而进行,但编辑也可能产生误导性的叙述。在本文中,我们提出一种概念上的转变,摆脱音频要么是“伪造”要么是“真实”的二元范式。相反,我们的重点是精确定位“语音编辑”,这涵盖了诸如滤波和剪切等传统修改,以及 TTS 合成和 VC 系统。我们划分了 6 个类别,并基于 M-AILABS 语料库构建了一个新的挑战数据集,为此我们提出了基线检测系统。最重要的是,我们认为仅仅将音频分类为伪造或真实是一种危险的过度简化,将无法推动语音技术领域的发展。
引用
@article{arxiv.2402.06304,
title = {A New Approach to Voice Authenticity},
author = {Nicolas M. Müller and Piotr Kawa and Shen Hu and Matthias Neu and Jennifer Williams and Philip Sperl and Konstantin Böttinger},
journal= {arXiv preprint arXiv:2402.06304},
year = {2024}
}