中文

通过源-输出声学一致性低成本检测劣质语音克隆

音频与语音处理 2026-05-12 v1

摘要

生成式语音的最新进展增加了自动检测明显失败的合成输出的需求。这在临床环境(如 AVATAR 疗法)中尤其重要,在该疗法中,精神分裂症患者与计算机生成的其幻听声音的表示进行交互,而劣质的合成可能会破坏沉浸感和治疗参与度。我们研究了低维、可解释的源-输出声学特征是否可以为检测劣质语音克隆输出提供轻量级的初筛检测器。受语音源-滤波器模型的启发,我们首先测试中位基频 (f0) 作为源相关的一致性度量,并将其与声道长度 (VTL) 作为滤波器相关度量以及谐波噪声比 (HNR) 作为噪声相关描述符进行比较。使用两种声码器系列 WaveRNN (n=54) 和 HiFi-GAN (n=40) 生成的人工标注语音克隆样本,在输入-输出特征空间中采用非对称阈值化程序进行评估。对于 WaveRNN,f0 和 HNR 均达到 85.2% 的准确率,优于 VTL (64.8%)。对于 HiFi-GAN,HNR 达到 80.0% 的准确率,其次是 f0 (77.5%) 和 VTL (67.5%)。样本级重叠和频谱图检查表明,f0 和 HNR 捕获了部分不同的失败模式,而不是提供相同样本的冗余排序。这些结果表明,简单的源-输出声学一致性度量可以为检测劣质语音克隆提供有用的初筛,并支持在需要快速拒绝失败合成语音的应用中使用可解释的基于阈值的筛选。

关键词

引用

@article{arxiv.2605.08165,
  title  = {Low-Cost Detection of Degraded Voice Clones via Source-Output Acoustic Consistency},
  author = {Jana Shokr and Minos Papadopoulos and Jeremy Cooperstock and Pavo Orepic},
  journal= {arXiv preprint arXiv:2605.08165},
  year   = {2026}
}

备注

7 pages, 3 figures