中文

重新审视 MUSHRA:应对语音合成评估中的现代挑战

计算与语言 2025-05-28 v3 机器学习 声音 音频与语音处理

摘要

尽管 TTS 模型取得了快速进展,但仍然缺乏一致且稳健的人工评估框架。例如,MOS 测试无法区分相似的模型,而 CMOS 的成对比较非常耗时。MUSHRA 测试是一种很有前景的同时评估多个 TTS 系统的替代方案,但在这项工作中,我们表明它对匹配人类参考语音的依赖会过度惩罚那些可能超越人类语音质量的现代 TTS 系统的得分。更具体地说,我们对 MUSHRA 测试进行了全面评估,重点关注其对评分者变异性、听者疲劳和参考偏差等因素的敏感性。基于涉及 492 名印地语和泰米尔语人类听者的广泛评估,我们发现了两个主要缺陷: 评分者受到人类参考过度影响的参考匹配偏差,以及 由于缺乏明确的细粒度指导原则而产生的判断模糊性。为了解决这些问题,我们提出了 MUSHRA 测试的两种改进变体。第一种变体能够对超越人类参考质量的合成样本进行更公平的评分。第二种变体减少了模糊性,表现为评分者之间的方差相对较低。通过结合这些方法,我们实现了更可靠和更细粒度的评估。我们还发布了 MANGO,一个包含 246,000 条人类评分的大型数据集,这是首个针对印度语言的此类数据集,有助于分析人类偏好并开发用于评估 TTS 系统的自动指标。

关键词

引用

@article{arxiv.2411.12719,
  title  = {Rethinking MUSHRA: Addressing Modern Challenges in Text-to-Speech Evaluation},
  author = {Praveen Srinivasa Varadhan and Amogh Gulati and Ashwin Sankar and Srija Anand and Anirudh Gupta and Anirudh Mukherjee and Shiva Kumar Marepally and Ankur Bhatia and Saloni Jaju and Suvrat Bhooshan and Mitesh M. Khapra},
  journal= {arXiv preprint arXiv:2411.12719},
  year   = {2025}
}

备注

Accepted in TMLR