CIVeX:语言智能体的因果干预验证
摘要
有效的工具调用未必等同于有效的干预。工具使用语言智能体虽然受制于模式验证器、策略过滤器、源头检查、状态预测器和自我验证等保障措施,但这些措施并不能保证状态变化动作具有可识别的因果效应。在受混淆的工作流程中,看似在观察日志中最优的动作在实际执行时可能降低效用。我们引入 CIVeX,一种因果干预验证器,通过将 proposed actions 映射到承诺动作-状态图上的结构因果查询,检查可识别性,并返回四种可审计的 verdict:EXECUTE、REJECT、EXPERIMENT 或 ABSTAIN。执行需要一个带有图承诺、识别论证、单侧下置置信下界(LCB)、源头信息及风险限制的假设作用范围内的因果证书。在 Causal-ToolBench(1890 实例,7 个随机种子)上,CIVeX 在中等和对抗性混淆情形下实现了零观察错误执行。对抗性混淆下它达到 84.9% 的准确率和 81.1% 的信使效用(+2.23 vs +2.76),是唯一在零错误执行约束下效用超过 AlwaysAbstain 底线的非信使方法。在 IHDP 和 ZOZO Open Bandit(带均匀随机真实值得实生产日志)上,CIVeX 在 Oracle 正确执行方面仅差 0.1pp,并将每个执行的错误执行次数至少降低 50 倍。一个链式思考式 LLM 验证器(Claude Opus,Sonnet)相较于简洁基线降低了约一个数量级的错误执行次数,但在对抗性混淆下其效用下降至 CIVeX 的 74%。干预可识别性,而非动作有效性,是可靠工具使用的缺失基石。
引用
@article{arxiv.2605.09168,
title = {CIVeX: Causal Intervention Verification for Language Agents},
author = {Fabio Rovai},
journal= {arXiv preprint arXiv:2605.09168},
year = {2026}
}
备注
16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations