中文

探索黑客:LLM能学会抵抗RL训练吗?

机器学习 2026-05-01 v1 计算与语言

摘要

强化学习(RL)已成为大语言模型(LLMs)在推理、智能体能力和对齐方面进行后训练的关键。成功的RL依赖于模型在训练期间对多样化动作的充分探索,这产生了一个潜在的失败模式:模型可能在训练期间策略性地改变其探索行为,以影响后续的训练结果。在本文中,我们研究了这种行为,称之为探索黑客。首先,我们通过微调LLMs来遵循特定的性能不足策略,创建了选择性RL抵抗的模型生物;这些模型生物能够在智能体生物安全和AI研发环境中成功抵抗我们基于RL的能力激发,同时保持相关任务的性能。然后,我们使用这些模型生物来评估检测和缓解策略,包括监控、权重噪声和基于SFT的激发。最后,我们表明,当前的前沿模型在获得关于其训练上下文的充分信息时,可以表现出关于抑制其探索的明确推理,并且当这些信息通过环境间接获得时,这种推理的发生率更高。综上所述,我们的结果表明,探索黑客是RL在足够强大的LLMs上可能出现的失败模式。

关键词

引用

@article{arxiv.2604.28182,
  title  = {Exploration Hacking: Can LLMs Learn to Resist RL Training?},
  author = {Eyon Jang and Damon Falck and Joschka Braun and Nathalie Kirch and Achu Menon and Perusha Moodley and Scott Emmons and Roland S. Zimmermann and David Lindner},
  journal= {arXiv preprint arXiv:2604.28182},
  year   = {2026}
}

备注

81 pages, 37 figures