中文

语音合成的现状:基于人类误导率的案例研究

计算与语言 2025-08-07 v1 机器学习 声音 音频与语音处理

摘要

虽然近年来的主观评估表明语音合成(TTS)正在快速进步,但当前的 TTS 系统是否能够通过类似图灵测试的人类误导测试?我们引入人类误导率(Human Fooling Rate, HFR),该指标直接衡量机器生成语音被误认为是人类语音的频率。我们对开源和商业 TTS 模型进行大规模评估,揭示了关键见解:(i) 基于 CMOS的人类parity主张在误导测试下常常失败;(ii) 应在人类语音实现高 HFR 的数据集上对 TTS 进展进行基准测试,因为评估于单调或表达不足的参考样本会设定较低的标准;(iii) 商业模型在零样本设置下接近人类误导,而开源系统在自然对话语音方面仍显不足;(iv) 在高质量数据上进行微调可提高逼真度,但并未完全弥合差距。我们的发现凸显了需要在现有主观测试之外进行更真实、以人类为中心的评估。

关键词

引用

@article{arxiv.2508.04179,
  title  = {The State Of TTS: A Case Study with Human Fooling Rates},
  author = {Praveen Srinivasa Varadhan and Sherry Thomas and Sai Teja M. S. and Suvrat Bhooshan and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2508.04179},
  year   = {2025}
}

备注

Accepted at InterSpeech 2025