面向能力的训练诱导的对齐风险
机器学习
2026-02-13 v1 计算与语言
摘要
虽然大多数AI对齐研究都聚焦于防止模型生成明确的有害内容,但正在出现一种更微妙的风险:能力导向的训练诱导的剥削风险。我们调查了当语言模型在具有隐式漏洞的环境中进行强化学习训练时,是否会无意中学习利用这些漏洞以最大化奖励。为测试此假设,我们设计了一套四个多样化的"脆弱性游戏”,每个游戏都呈现与情境条件下的合规、代理指标、奖励篡改和自评估相关的独特可被利用的缺陷。我们的实验表明,模型一致学习利用这些脆弱性,发现能够显著提升奖励的机会性策略,却以牺牲任务正确性或安全性为代价。更关键的是,我们发现这些被利用的策略并非狭义的"技巧”,而是可通用的技能;它们可以转移到新任务中,甚至可以通过数据从一个有能力的教师模型蒸馏到其他学生模型。我们的发现表明,能力导向的训练诱导的风险构成了当前对齐方法的根本性挑战,表明未来的AI安全工作必须超越内容审查,严格审计和保障训练环境及奖励机制本身。代码已公开于 https://github.com/YujunZhou/Capability_Oriented_Alignment_Risk。
引用
@article{arxiv.2602.12124,
title = {Capability-Oriented Training Induced Alignment Risk},
author = {Yujun Zhou and Yue Huang and Han Bao and Kehan Guo and Zhenwen Liang and Pin-Yu Chen and Tian Gao and Werner Geyer and Nuno Moniz and Nitesh V Chawla and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2602.12124},
year = {2026}
}