中文

分布迁移下弱到强奖励模型的失效: 偏好迁移评估

计算与语言 2026-05-27 v2 机器学习

摘要

弱到强(W2S)泛化是可扩展监督的有前景框架,但现有评估常在匹配的训练测试分布下进行测试。因此,我们研究在零射线分布迁移下的W2S偏好学习,发现在分布迁移下,训练于弱偏好标签的强学生模型可能在分布匹配时表现良好,但在跨偏好数据集时难以迁移。我们提供证据表明,弱监督微调可能导致模型向源域特征倾斜,而非保持广泛可迁移的偏好表征。为缓解此问题,我们提出表示锚定(Anchor),即一种简单有效的正则化方法,约束微调过程中模型表征空间的过度漂移,同时仍允许任务相关适应。在多个偏好域、数据集和模型族中,Anchor consistently改善了跨分布迁移,同时保持竞争的分布内性能。总之,我们的评估协议、传递感知指标和方法暴露了当前W2S奖励建模中的隐藏脆弱性,并为更健壮的偏好传递提供了实用路径。

关键词

引用

@article{arxiv.2605.25629,
  title  = {When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift},
  author = {Khoi Le and Tri Cao and Phong Nguyen and Cong-Duy Nguyen and Anh Tuan Luu and Miao Chunyan and See-Kiong Ng and Thong Nguyen},
  journal= {arXiv preprint arXiv:2605.25629},
  year   = {2026}
}

备注

Code: https://anonymous.4open.science/r/w2s_reward_ood-682F