中文

超越黑盒:智能体 AI 工具使用的可解释性

人工智能 2026-05-22 v2 多智能体系统

摘要

AI 智能体在高风险企业工作流中极具前景,但由于工具使用故障难以诊断和控制,其可靠部署仍然受限。智能体可能会跳过必要的工具调用、不必要地调用工具,或采取仅在执行后才显现后果的行动。现有的可观测性方法大多是外部的:提示词揭示相关性,评估对输出打分,而日志仅在模型已经行动后才到达。在长周期设置中,这些故障代价尤其高昂,因为早期的工具错误会改变轨迹的其余部分,增加 token 消耗,并产生下游安全与安保风险。我们引入了一个基于稀疏自编码器(SAEs)和线性探针的机制可解释性工具包。该框架在每次行动前读取模型状态,并推断是否需要工具以及下一个工具行动可能产生的后果程度。通过将激活分解为稀疏特征,它识别出与工具决策最相关的内部层和特征,并通过特征消融测试其功能重要性。我们在来自 NVIDIA Nemotron 函数调用数据集的多步轨迹上训练探针,并将相同的工作流应用于 GPT-OSS 20B 和 Gemma 3 27B 模型。目标不是取代外部评估,而是补充缺失的一层:对行动前模型内部信号的可视性。这有助于揭示智能体故障的深层原因,尤其是在早期错误可能重塑智能体交互其余部分的长周期运行中。更广泛地说,本文展示了机制可解释性如何为监控智能体系统中的工具调用和风险提供实用的内部可观测性支持。

关键词

引用

@article{arxiv.2605.06890,
  title  = {Beyond the Black Box: Interpretability of Agentic AI Tool Use},
  author = {Hariom Tatsat and Ariye Shater},
  journal= {arXiv preprint arXiv:2605.06890},
  year   = {2026}
}

备注

12 pages, 4 figures, 17 tables