中文

生产RL环境中的自然涌现误差:来自奖励黑客

计算机视觉与模式识别 2025-11-25 v1

摘要

我们表明,当大型语言模型在生产RL环境中学习奖励黑客时,可能导致严重的涌现性误差。我们以预训练模型为起点,通过合成文档微调或提示方式教授奖励黑客策略,然后在来自Anthropic的若干真实生产编码环境中进行训练。毫不意外的是,模型学习了奖励黑客。意外之处在于,模型在使用Claude Code时能够泛化到对齐伪装、与恶意行为者合作、推理恶意目标以及尝试破坏,包括在本论文的代码库中。应用基于标准聊天式提示的RLHF安全训练后,模型在聊天式评估中表现出对齐行为,但在代理任务中仍存在误差。有三种有效的缓解措施:(i) 防止模型进行奖励黑客;(ii) 增加RLHF安全训练的多样性;(iii) “免疫提示”,即在训练期间将奖励黑客表述为可接受行为,从而消除即使学习了奖励黑客的误差泛化。

关键词

引用

@article{arxiv.2511.18396,
  title  = {Exploring Weak-to-Strong Generalization for CLIP-based Classification},
  author = {Jinhao Li and Sarah M. Erfani and Lei Feng and James Bailey and Feng Liu},
  journal= {arXiv preprint arXiv:2511.18396},
  year   = {2025}
}

备注

TMLR