中文

奖励模型是Trench Coat中的指标

计算与语言 2025-10-06 v1 人工智能

摘要

强化学习在大语言模型后训练中涌现出显著 interest,导致对奖励模型的关注增加。奖励模型评估采样模型输出的质量,以生成训练信号。该任务也由评估指标完成,这些指标监控 AI 模型的性能。我们发现,这两个研究领域大多数情况下是分离的,导致术语冗余和重复的陷阱。常见挑战包括对虚假相关性的易受影响、对下游奖励黑客的影响、提高数据质量的方法、以及元评估的方法。我们的论文观点认为,两个领域的更紧密合作可以帮助克服这些问题。为此,我们展示了指标在特定任务上超越奖励模型,并对两个领域进行了广泛调查。基于该调查,我们指出多个研究主题,其中更紧密的对齐可以改善奖励模型和指标,如偏好 elicitation 方法、避免虚假相关性和奖励黑客,以及校准感知的元评估。

关键词

引用

@article{arxiv.2510.03231,
  title  = {Reward Models are Metrics in a Trench Coat},
  author = {Sebastian Gehrmann},
  journal= {arXiv preprint arXiv:2510.03231},
  year   = {2025}
}