Project Ariadne:用于审计 LLM 代理忠诚度的结构因果框架
人工智能
2026-01-06 v1
摘要
随着大语言模型 (LLM) 代理被赋予高风险的自主决策任务,其推理过程的透明度已成为关键安全议题。虽然链式思考 (CoT) 提示允许代理生成可读的推理轨迹,但这些轨迹是否真正驱动模型输出,抑或仅是事后事后合理化,尚不明确。我们提出 Project Ariadne,一种新型可解释人工智能 (XAI) 框架,利用结构因果模型 (SCM) 和反事实逻辑审计代理推理的因果完整性。不同于依赖表面文本相似性的现有方法,Project Ariadne 对中间推理节点执行硬性干预 (-calculus)——系统性地反转逻辑、否定前提、逆转事实陈述——以衡量其终端答案的因果敏感性 ()。我们的实证评估揭示持续存在的“忠诚度鸿沟”。我们定义并检测一种广泛存在的失效模式,称为“因果脱钩”,其中代理在事实与科学领域的违规密度 () 可达 0.77。这些情况下,代理尽管内部逻辑矛盾,仍得出相同结论,证明其推理轨迹仅是“推理戏剧化”,而决策实际由潜在参数先验控制。我们的发现表明当前代理架构本质上易于产生非忠诚解释,我们提出 Ariadne 分数作为一种新基准,用于对齐陈述逻辑与模型实际行动。
引用
@article{arxiv.2601.02314,
title = {Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents},
author = {Sourena Khanzadeh},
journal= {arXiv preprint arXiv:2601.02314},
year = {2026}
}