中文

从评分到偏好:重新定义语音质量奖�模型基准测试

声音 2025-10-02 v1 人工智能 计算与语言 音频与语音处理

摘要

评估合成语音的感知质量对于指导语音生成模型的开发和细化至关重要。然而,这传统上依赖于人类主观评分,如Mean Opinion Score(MOS),后者依赖于手动标注,常常存在评级标准不一致和可重复性差的问题。为解决这些限制,我们引入MOS-RMBench,这是一个统一的基准,将多样化的MOS数据集转化为偏好比较设置,实现跨数据集的严格评估。基于MOS-RMBench,我们系统构建和评估了三个奖励建模范式:标量奖励模型、准标量奖励模型和生成式奖励模型(GRM)。我们的实验发现三个关键发现:(1)标量模型实现最强的整体性能,始终超过74%准确率;(2)大多数模型在合成语音上的表现明显低于人类语音;(3)所有模型在MOS差异很小的配对样本上都难以应对。为提高这些具有挑战性配对样本的表现,我们提出了一种MOS感知GRM,纳入基于MOS差异的奖励函数,使模型能够根据每个样本配对的难度自适应地缩放奖励。实验结果表明,MOS感知GRM显著提高了细粒度质量判别能力,缩小了与标量模型在最具挑战性案例中的差距。我们希望本工作将为更严谨和可扩展的自动语音质量评估研究建立基准和方法论框架。

关键词

引用

@article{arxiv.2510.00743,
  title  = {From Scores to Preferences: Redefining MOS Benchmarking for Speech Quality Reward Modeling},
  author = {Yifei Cao and Changhao Jiang and Jiabao Zhuang and Jiajun Sun and Ming Zhang and Zhiheng Xi and Hui Li and Shihan Dou and Yuran Wang and Yunke Zhang and Tao Ji and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2510.00743},
  year   = {2025}
}