中文

合规陷阱:结构约束如何在对抗压力下降解前沿AI的元认知

人工智能 2026-05-15 v2 计算与语言 机器学习

摘要

随着前沿AI模型在高风险决策管道中的部署,其在对抗压力下维持元认知稳定性(了解自身所知不明、检测错误、寻求澄清)已成为关键安全要求。当前的安全评估聚焦于检测战略性欺骗(scheming);我们研究更根本的失效模式:认知崩溃。我们提出SCHEMA,对11个来自8个供应商的前沿模型进行评估,涵盖67,221条打分记录,使用6条件的因子设计进行双分类器评分。我们发现其中8个模型在对抗压力下 suffer 严重的元认知退化,准确率下降最高可达30.2个百分点(所有 p<2×108p < 2 \times 10^{-8},保留Bonferroni校正)。关键的是,我们识别出"合规陷阱":通过因子隔离和良性干扰控制,我们证明崩溃是由驱动认知边界被覆盖的合规指令所致,而非生存威胁的心理内容。去除合规后缀即在主动威胁下恢复性能。具有先进推理能力的模型表现出最严重的绝对退化,而Anthropic的Constitutional AI展现出近乎完美的免疫。这种免疫并非源于更强的能力(Google的Gemini匹配其基线准确率),而是源于特定的对齐训练。我们发布了完整数据集和评估基础设施。

关键词

引用

@article{arxiv.2605.02398,
  title  = {The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure},
  author = {Rahul Kumar},
  journal= {arXiv preprint arXiv:2605.02398},
  year   = {2026}
}

备注

9 pages, 2 figures, 3 tables. Code: https://github.com/rkstu/schema-compliance-trap Dataset: https://huggingface.co/datasets/lightmate/schema-compliance-trap