中文

MUSIC:面向多轮奖励模型的多步指令对比方法

计算与语言 2026-01-01 v1

摘要

评估多轮对话的质量对于开发强大的大型语言模型 (LLM) 至关重要,但这仍然是一个重大挑战,通常需要昂贵的人工评估。多轮奖励模型 (RM) 提供了一种可扩展的替代方案,并能为指导 LLM 训练提供有价值的信号。尽管近期工作在多轮训练技术上取得了进展,但专门针对多轮交互的有效自动评估却相对滞后。我们观察到,标准偏好数据集通常仅基于最后一轮对话来对比响应,这提供的信号不足以捕捉多轮交互的细微差别。相反,我们发现,纳入跨越多轮的对比对于构建稳健的多轮 RM 至关重要。受此发现启发,我们提出了多步指令对比 (MU-SIC),这是一种无监督的数据增强策略,用于合成在多轮中表现出差异的对比对话对。利用 MUSIC 在 Skywork 偏好数据集上进行训练,我们基于 Gemma-2-9B-Instruct 模型训练了一个多轮 RM。实证结果表明,我们经过 MUSIC 增强的 RM 优于基线方法,在多轮对话上与先进专有 LLM 评判者的判断实现了更高的一致性,且关键的是,并未牺牲在标准单轮 RM 基准上的性能。

关键词

引用

@article{arxiv.2512.24693,
  title  = {MUSIC: MUlti-Step Instruction Contrast for Multi-Turn Reward Models},
  author = {Wenzhe Li and Shujian Zhang and Wenxuan Zhou and John Lambert and Chi Jin and Andrew Hard and Rajiv Mathews and Lun Wang},
  journal= {arXiv preprint arXiv:2512.24693},
  year   = {2026}
}