中文

面向交互式口语对话模型中语义与话轮切换鲁棒性的双轴生成式奖励模型

人工智能 2026-04-17 v1

摘要

实现无缝、类人的交互仍然是全双工口语对话模型(SDM)面临的关键挑战。强化学习(RL)已显著增强了文本和视觉语言模型,而精心设计的奖励信号对于RL的性能至关重要。我们认为RL是应对SDM关键挑战的一种有前景的策略。然而,一个根本性障碍依然存在:当前用于评估交互质量的自动化指标依赖于表面代理,例如行为统计或时序预测准确性,无法为RL提供可靠的奖励信号。另一方面,人工评估尽管内容丰富,但成本高昂、不一致且难以扩展。我们通过提出一种双轴生成式奖励模型来应对这一关键障碍,该模型经过训练,能够使用详细的分类法和带注释的数据集理解复杂的交互动态,生成单一分数,并且至关重要的是,为语义质量和交互时序提供独立的评估。这种双输出为SDM提供了精确的诊断反馈,并为在线强化学习提供了可靠且具有指导性的奖励信号。我们的模型在涵盖合成对话和复杂真实世界交互的广泛数据集上,在交互质量评估方面达到了最先进的性能。

关键词

引用

@article{arxiv.2604.14920,
  title  = {Dual-Axis Generative Reward Model Toward Semantic and Turn-taking Robustness in Interactive Spoken Dialogue Models},
  author = {Yifu Chen and Shengpeng Ji and Zhengqing Liu and Qian Chen and Wen Wang and Ziqing Wang and Yangzhuo Li and Tianle Liang and Zhou Zhao},
  journal= {arXiv preprint arXiv:2604.14920},
  year   = {2026}
}