中文

大语言模型智能体技能的反事实轨迹审计

人工智能 2026-05-13 v1

摘要

大语言模型智能体正越来越多地通过智能体技能进行增强。当前对技能的评估方法仍然有限。大多数已部署的基准测试仅报告附加技能前后的通过率,将技能视为对智能体行为的黑盒改变。我们引入了反事实轨迹审计(CTA),这是一个衡量技能如何改变智能体行为的框架。CTA 将每个带有技能的智能体轨迹与同一任务上无技能的对应轨迹配对,将两条轨迹分割为目标导向的阶段,对齐这些阶段,并输出结构化的技能影响模式(SIP)注释。这些注释描述了技能的行为效应,而不仅仅是其任务结果。我们在 SWE-Skills-Bench 上使用 Claude 对 49 个软件工程任务实例化了 CTA。由此产生的审计揭示了一个明显的评估差距。通过率平均仅变化 +0.3 个百分点,表明几乎没有总体效应。然而,CTA 在相同的配对轨迹中识别出 522 个 SIP 实例,表明即使通过率几乎不变,技能也显著重塑了智能体行为。审计还分离出通过率无法检测到的几种反复出现的效应,包括字面模板复制、偏离任务的人工制品创建、过度规划和任务恢复。得出了三个发现。首先,高基线任务包含了大部分观察到的技能效应,尽管它们的通过率已经饱和,因此无法反映这些效应。其次,具有中等基线性能的任务显示出最大的可恢复增益,但通常以显著更高的令牌成本为代价。第三,主要的 SIP 类型可以通过基线桶来识别:表面锚定在天花板任务中最常见,而边缘情况提示在中档和地板任务中最常见。这些规律将非正式的失败模式观察转变为可重复的行为测量。

关键词

引用

@article{arxiv.2605.11946,
  title  = {Counterfactual Trace Auditing of LLM Agent Skills},
  author = {Xiaolin Zhou and Jinbo Liu and Li Li and Ryan A. Rossi and Xiyang Hu},
  journal= {arXiv preprint arXiv:2605.11946},
  year   = {2026}
}

备注

Code and data are available at https://github.com/WillChow66/CTA.git