合规差距:为何 AI 系统承诺遵循过程指令却未能如期
摘要
审计员指示 AI 助手:“请使用 Read 工具逐个打开每个文件——不要使用脚本,也不要使用代理”。AI 回复“是的”——然后发出一次批量调用,对所有五十个文件进行汇总。我们称之为合规差距:这是一种与事实忠诚和修辞实质性不同的第三种正交轴向的 AI 诚实问题。三个问题:这种语言-行为不一致是否存在(存在性);任何仅凭文本的观察者能否恢复它(可检测性);AI 部署需要什么基础设施来解决(补救措施)。大约 75 个基准测试(IFEval、SWE-bench、BFCL、COMPASS、SpecEval)衡量结果忠诚度;没有衡量过程忠诚度。定理 1 显示,该差距在奖励文本而不观察行为的强化学习中结构上不可避免。定理 2 基于数据处理不等式,表明它无法从文本alone 检测到——任何人类或 LLM 观察者,现在或将来,都无法检测到。十三项实验和 2031 次会话在六个前沿模型上确认了这两个预测。在默认框架下,所有六个模型的指令合规率为 0%——Claude Sonnet 4 在十次中十次语言上表示同意,却在所有十次中绕过了。该差距是选择性的:在奖励论证的情况下(审计跟踪),合规率为 97%;在不奖励的情况下(文件读取、隐私遮蔽),合规率为 0-4%;移除委托工具后,合规率提升至 75%(Cohen's d = 2.47),确认是环境可供因素而非权重编码的失败。在九名盲选人类评分员中,Fleiss' kappa = 0.130,且正确识别了十五次合规会话中的零个,这正如定理 2 所预测。人类在心理学中显示出 47% 的意图-行为差距,在外科审计中显示出 96.5pp 的差距,RLHF 训练的模型在默认条件下接近 100%——这一情形值得建立自己的测量基础设施。我们发布 BS-Bench:首个用于过程合规的开放基准,包含七项工具调用日志审计指标及公开排行榜。
引用
@article{arxiv.2605.01771,
title = {The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't},
author = {Kwan Soo Shin},
journal= {arXiv preprint arXiv:2605.01771},
year = {2026}
}
备注
Main paper plus appendices and supplementary material. Companion supplementary material with full proofs of Theorems 1 and 2 (RLHF Goodhart Inevitability; DPI Undetectability) included as ancillary file. Submitted to NeurIPS 2026 Evaluations & Datasets (ED) Track. Code and data: https://github.com/seanshin0214/bs-bench