UrgentMOS:用于鲁棒语音质量评估的统一多指标与偏好学习
声音
2026-01-27 v1
摘要
随着现代语音生成系统不断进步,自动语音质量评估变得日益重要,而人工听力测试仍然成本高昂、耗时且难以规模化。大多数现有的基于学习的评估模型主要依赖稀缺的人工标注平均意见分(MOS)数据,这限制了鲁棒性和泛化能力,尤其是在跨异构数据集训练时。在本工作中,我们提出了 UrgentMOS,这是一个统一的语音质量评估框架,该框架从多种客观和感知质量指标中联合学习,同时在训练期间明确容忍任意指标子集的缺失。通过利用异构监督下的互补质量特征,UrgentMOS 能够有效利用部分标注数据,并在大规模、多源数据集上训练时提高鲁棒性。除了绝对分数预测之外,UrgentMOS 通过直接预测比较平均意见分(CMOS)来显式建模成对质量偏好,使其非常适合系统基准测试中常用的基于偏好的评估场景。在包括模拟失真、语音增强和语音合成在内的广泛语音质量数据集上进行的广泛实验表明,UrgentMOS 在绝对和比较评估设置中均持续取得 SOTA 性能。
引用
@article{arxiv.2601.18438,
title = {UrgentMOS: Unified Multi-Metric and Preference Learning for Robust Speech Quality Assessment},
author = {Wei Wang and Wangyou Zhang and Chenda Li and Jiahe Wang and Samuele Cornell and Marvin Sach and Kohei Saijo and Yihui Fu and Zhaoheng Ni and Bing Han and Xun Gong and Mengxiao Bi and Tim Fingscheidt and Shinji Watanabe and Yanmin Qian},
journal= {arXiv preprint arXiv:2601.18438},
year = {2026}
}