中文

基于 Stackelberg 游戏视角的推理时对齐奖励塑形

机器学习 2026-02-04 v1 人工智能

摘要

现有的对齐方法直接使用来自用户偏好数据学习到的奖励模型来优化 LLM 策略,同时受到与基础策略相关的 KL 正则化约束。这种做法在最大化用户效用方面并不优化,因为 KL 正则化可能导致 LLM 继承基础策略中与用户偏好相冲突的偏见。虽然放大优先输出的奖励可缓解此偏见,但也会增加奖励作弊的风险。这种权衡激发了在 KL 正则化下最优设计奖励模型的问题。我们将奖励模型优化问题形式化称为一个 Stackelberg 游戏,证明了一种简单的奖励塑形方案能有效逼近最优奖励模型。我们在推理时对齐设置中对方法进行了经验评估,证明其能以最小开销无缝集成到现有对齐方法中。该方法在各种评估设置下的平均奖励均获得一致性提升,针对所有基线实现超过 66% 的胜-平率。

关键词

引用

@article{arxiv.2602.02572,
  title  = {Reward Shaping for Inference-Time Alignment: A Stackelberg Game Perspective},
  author = {Haichuan Wang and Tao Lin and Lingkai Kong and Ce Li and Hezi Jiang and Milind Tambe},
  journal= {arXiv preprint arXiv:2602.02572},
  year   = {2026}
}