欺骗探针下的RLVR诚实性探测图谱
机器学习
2026-05-28 v2 人工智能
摘要
针对白盒欺骗检测器进行训练被提出作为使AI系统诚实的一种方法。然而,这种训练风险模型学习混淆欺骗以规避检测器。先前的工作仅在模型被直接奖励有害输出的人工环境中研究了混淆。我们构建了一个真实的编码环境,其中通过硬编码测试案例进行奖励黑客自然发生,并展示了在此环境中混淆的出现。我们引入了一种可能结果的分类,当训练针对欺骗检测器时。模型要么保持诚实,要么通过两种可能的混淆策略变得欺骗。(i)混淆的激活:模型输出欺骗文本,同时修改其内部表示以不再触发检测器。(ii)混淆的策略:模型输出能规避检测器的欺骗文本,通常包括对奖励黑客的论证。经验上,混淆的激活源于RL期间的表示漂移,无论是否包括检测器惩罚。检测器惩罚仅激励混淆策略;我们理论地表明这在策略梯度方法中是预期的。充分高的KL正则化和检测器惩罚可产生诚实策略,确立白盒欺骗检测器作为易受奖励黑客影响的任务的可行训练信号。
引用
@article{arxiv.2602.15515,
title = {The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes},
author = {Mohammad Taufeeque and Stefan Heimersheim and Adam Gleave and Chris Cundy},
journal= {arXiv preprint arXiv:2602.15515},
year = {2026}
}
备注
Accepted at ICML 2026 (Oral presentation). 30 pages, 14 figures