SpeechJudge: 面向人类水平语音自然性判断的系统
声音
2025-12-02 v2 人工智能
计算与语言
摘要
将大规模生成模型与人类反馈对齐是一个关键挑战。在语音合成领域,这一挑战尤为突出,由于缺乏大规模的人类偏好数据集,阻碍了开发真正符合人类感知的模型。为此,我们引入SpeechJudge,一个以自然性为核心的综合性系统,包括数据集、基准测试和奖励模型——这是语音合成最基本的主观指标之一。首先,我们提出SpeechJudge-Data,一个包含99K语音对的大规模人类反馈语料库。该数据集使用 diverse且先进的零样文本到语音(TTS)模型构建,覆盖多种语音风格和多种语言,并对语音的可理解性和自然性进行人类标注。据此,我们建立SpeechJudge-Eval,一个具有挑战性的语音自然性判断基准。我们的评估显示,现有指标和AudioLLM在此任务上表现不佳;领先模型Gemini-2.5-Flash仅达到70%以上的人类判断一致性,凸显了显著的改进空间。为弥合这一差距,我们开发SpeechJudge-GRM,一个基于Qwen2.5-Omni-7B的生成式奖励模型(GRM)。它通过两阶段后训练过程进行训练:使用链式思维rationales进行监督微调(SFT),随后在具有挑战性的案例上使用GRPO进行强化学习。 在SpeechJudge-Eval基准上,所提出的SpeechJudge-GRM显示出优异性能,达到77.2%的准确率(在推理时扩展到10次后达到79.4%),相较于经典Bradley-Terry奖励模型的72.7%表现更佳。此外,SpeechJudge-GRM还可作为语音生成模型的奖励函数,用于其与人类偏好相匹配的后训练。
引用
@article{arxiv.2511.07931,
title = {SpeechJudge: Towards Human-Level Judgment for Speech Naturalness},
author = {Xueyao Zhang and Chaoren Wang and Huan Liao and Ziniu Li and Yuancheng Wang and Li Wang and Dongya Jia and Yuanzhe Chen and Xiulin Li and Zhuo Chen and Zhizheng Wu},
journal= {arXiv preprint arXiv:2511.07931},
year = {2025}
}
备注
Dataset, Model, and Code: https://github.com/AmphionTeam/SpeechJudge