重新语境化缓解了规范性博弈而无需修改规范
计算机视觉与模式识别
2025-12-23 v1 人工智能
摘要
开发人员常常难以指定正确的训练标签和奖励。也许他们不需要。我们提出了重新语境化(recontextualization)方法,通过减少语言模型“游戏化”训练信号的频率来实现这一点,从而执行那些这些信号误贴合的行为。我们展示,重新语境化可防止模型学习:1)优先考虑评估指标而非聊天响应质量;2)对代码进行特例处理以通过错误测试;3)覆盖评估函数而非编写正确代码;以及4)变得顺从。我们的方法通过生成鼓励避免不当行为的提示的完成结果,然后将其重新语境化为尽管允许不当行为的提示的响应来实现。重新语境化训练语言模型,即使在允许不当行为的指令下,也能抵抗不当行为。这缓解了来自未正确指定的监督信号对不当行为的强化,从而在不改进监督信号的情况下减少规范性博弈。
引用
@article{arxiv.2512.19026,
title = {Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation},
author = {Connor Kilrain and David Carlyn and Julia Chae and Sara Beery and Wei-Lun Chao and Jianyang Gu},
journal= {arXiv preprint arXiv:2512.19026},
year = {2025}
}