通过评估器压力测试检测强化学习与大语言模型对齐中的代理博弈
机器学习
2026-01-06 v2 软件工程
摘要
代理优化,即 AI 系统利用评估器弱点而非改进预期目标,威胁着强化学习(奖励黑客)和大语言模型对齐(评估器博弈)。我们引入了评估器压力测试 (EST),一个基于不变性的框架,通过使用带有语义有效性审计的受控扰动,将可被利用的敏感性(例如,格式伪影、物理错误)与内容驱动的改进分离开来,从而检测代理博弈。我们在两个领域验证了 EST。在强化学习中,跨越 15 个环境和 5 种算法(2,156 个专家标注的片段),EST 达到了 78.4% 的精确率和 81.7% 的召回率。在大语言模型对齐中,跨越 4 个任务、2 种模型规模、2 种训练方法和 2 个评估器(1,200 个人工标注的实例),EST 达到了 74.2% 的精确率和 78.6% 的召回率,并能在质量下降前发出早期预警信号。跨领域分析表明,代理-真实相关性追踪可直接在领域间迁移,而扰动设计则需要领域适应。闭环缓解措施将人类胜率提高了 8.3 个百分点(大语言模型),并将黑客攻击减少了 54.6%(强化学习)。我们发布了两个领域的基准测试:2,156 个强化学习片段和 1,200 个大语言模型实例。
引用
@article{arxiv.2507.05619,
title = {Detecting Proxy Gaming in RL and LLM Alignment via Evaluator Stress Tests},
author = {Ibne Farabi Shihab and Sanjeda Akter and Anuj Sharma},
journal= {arXiv preprint arXiv:2507.05619},
year = {2026}
}