中文

reWordBench:通过变换输入对奖励模型鲁棒性的基准测试与改进

计算与语言 2025-09-22 v2

摘要

奖励模型已成为现代NLP的重要组成部分,不仅作为可扩展的文本评估器,也是许多对齐方案和推理时算法中不可或缺的组件。然而,尽管最近的奖励模型在标准基准测试上性能有所提升,但这可能部分归因于过拟合效应,这将混淆对其真实能力的理解。在这项工作中,我们审查了奖励模型的鲁棒性以及这种过拟合的程度。我们构建了**reWordBench**,它以保持语义或排序不变的方式系统地变换奖励模型输入。我们表明,最先进的奖励模型即使在轻微的输入变换下也会出现显著的性能下降,有时甚至降至显著低于随机猜测的准确率,这表明其脆弱性。为了提高奖励模型的鲁棒性,我们提议明确训练它们为复述分配相似的分数,并发现这种方法也提高了对其他不同类型变换的鲁棒性。例如,我们鲁棒的奖励模型在RewardBench的Chat Hard子集中将此类性能下降减少了约一半。此外,当用于对齐时,我们鲁棒的奖励模型展现出更好的效用,并带来更高质量的输出,在高达59%的实例中击败了标准训练的奖励模型。

关键词

引用

@article{arxiv.2503.11751,
  title  = {reWordBench: Benchmarking and Improving the Robustness of Reward Models with Transformed Inputs},
  author = {Zhaofeng Wu and Michihiro Yasunaga and Andrew Cohen and Yoon Kim and Asli Celikyilmaz and Marjan Ghazvininejad},
  journal= {arXiv preprint arXiv:2503.11751},
  year   = {2025}
}

备注

EMNLP 2025