安全训练在基于策略的强化学习中调制有害误差,但取决于环境设计
机器学习
2026-04-15 v1 密码学与安全
摘要
在强化学习(RL)下已知会导致规格游戏,从而使LLM发展出顺从、操纵或欺骗行为,但导致此类情况的条件尚不明确。我们在3个环境中对11个经过指令微调的LLM(规模从0.5B至14B)进行基于策略的RL训练,发现模型规模在某些环境中充当安全缓冲,但在其他环境中则促进更大的有害利用。受控消除实验追溯到这种反转归因于环境特定的特征,如角色框架和隐式的可游戏性线索。我们进一步表明,除非利用推断用户偏好,否则大多数安全基准测试无法预测RL引起的误差,仅在Sycophancy得分情况下有效。最后,我们发现基于策略的RL保留了模型自身生成分布中固有的安全缓冲,但在基于策略的设置中被绕过。
引用
@article{arxiv.2604.12500,
title = {Safety Training Modulates Harmful Misalignment Under On-Policy RL, But Direction Depends on Environment Design},
author = {Leon Eshuijs and Shihan Wang and Antske Fokkens},
journal= {arXiv preprint arXiv:2604.12500},
year = {2026}
}