中文

DeceptGuard:面向LLM代理检测欺骗行为的宪法监督框架

计算与语言 2026-03-17 v1

摘要

可靠检测大语言模型(LLM)代理中的欺骗行为,是确保其在高风险代理场景中安全部署的关键前提。目前针对scheming检测的工作仅关注黑箱监控器,仅观察外部可见的工具调用与输出,丢弃了 potentially rich 的内部推理信号。我们引入DECEPTGUARD,一个统一框架,系统性地比较三种监控模式:黑箱监控器(仅限动作与输出)、CoT感知监控器(额外观察代理的链式思维推理轨迹)以及激活探针监控器(额外读取冻结开源编码器的隐藏状态表示)。我们引入DECEPTSYNTH,一个可扩展的合成管道,用于生成跨越12类新颖分类的欺骗阳性与欺骗阴性代理轨迹。我们的监控器在4800个合成轨迹上进行优化,并在9200个来自DeceptArena的持留样本上进行评估——DeceptArena是一个带有执行验证标签的真实沙盒化代理环境基准。 在所有评估场景下,CoT感知监控器和激活探针监控器均显著优于黑箱监控器(平均pAUROC提升+0.097),在那些仅留下最小行为痕迹的微妙、长时程欺骗问题上提升尤为显著。我们经验性地刻画了透明度与可检测性之间的权衡:随着代理学习抑制明显行为信号,链式思维成为主要检测表面,但本身因事后训练忠诚度退化而日益不可靠。我们提出HYBRID-CONSTITUTIONAL集成作为一种robust防御性方法,实现了在持留测试集上的0.934的pAUROC,代表了对现有最佳技术的显著进步。

关键词

引用

@article{arxiv.2603.13791,
  title  = {DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents},
  author = {Snehasis Mukhopadhyay},
  journal= {arXiv preprint arXiv:2603.13791},
  year   = {2026}
}