中文

GSRM:面向语音RLHF的生成式语音奖励模型

声音 2026-02-17 v1 人工智能

摘要

近期语音语言模型(如GPT-4o Voice Mode和Gemini Live)已展示出有前景的语音生成能力。然而,合成音频的审美自然性仍滞后于人类语音。提升生成质量需要可靠的语音自然性评估器。然而,现有自然性评估器通常回归原始音频到标量分数,评估可解释性有限,而且难以泛化到不同分类法下的语音。灵感来自生成式奖励建模的最新进展,我们提出了生成式语音奖励模型(GSRM),这是一种面向语音的推理导向奖励模型。GSRM被训练将语音自然性评估分解为可解释的声学特征提取阶段,再进行基于特征的链式思考推理,实现可解释判断。为此,我们构建了大规模人类反馈数据集,包含3.1万条专家评分以及真实世界用户-助理语音交互的外部领域基准。实验表明,GSRM显著优于现有语音自然性预测器,实现模型-人类自然性评分预测的相关性接近人类评估者间的一致性。我们进一步展示了GSRM可作为有效验证器,用于提升语音LLM生成的自然性,通过在线RLHF。

关键词

引用

@article{arxiv.2602.13891,
  title  = {GSRM: Generative Speech Reward Model for Speech RLHF},
  author = {Maohao Shen and Tejas Jayashankar and Osama Hanna and Naoyuki Kanda and Yancheng Wang and Kateřina Žmolíková and Ruiming Xie and Niko Moritz and Anfeng Xu and Yashesh Gaur and Gregory Wornell and Qing He and Jilong Wu},
  journal= {arXiv preprint arXiv:2602.13891},
  year   = {2026}
}