从动作到理解:LLM 智能体中时间概念的共形可解释性
人工智能
2026-04-23 v1 计算与语言
新兴技术
多智能体系统
机器人学
摘要
大型语言模型(LLM)越来越多地被部署为能够在交互环境中进行推理、规划和行动的自主智能体。尽管它们执行多步推理和决策任务的能力不断增强,但指导其序列行为的内部机制仍不透明。本文提出了一个框架,通过逐步共形视角来解释 LLM 智能体中概念的时序演化。我们引入了用于时序任务的共形可解释性框架,该框架将逐步奖励建模与共形预测相结合,在统计上将模型每一步的内部表示标记为成功或失败。然后在这些表示上训练线性探针,以识别时间概念的方向——即模型激活空间中与成功、失败或推理漂移等一致概念相对应的潜在方向。在两个模拟交互环境(即 ScienceWorld 和 AlfWorld)上的实验结果表明,这些时间概念是线性可分的,揭示了与任务成功相一致的可解释结构。我们进一步展示了利用所提框架引导模型内部已识别的成功方向以提升 LLM 智能体性能的初步结果。因此,所提方法为基于 LLM 的智能体提供了早期故障检测和干预的有原则方法,为在复杂交互环境中构建可信赖的自主语言模型铺平了道路。
引用
@article{arxiv.2604.19775,
title = {From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents},
author = {Trilok Padhi and Ramneet Kaur and Krishiv Agarwal and Adam D. Cobb and Daniel Elenius and Manoj Acharya and Colin Samplawski and Alexander M. Berenbeim and Nathaniel D. Bastian and Susmit Jha and Anirban Roy},
journal= {arXiv preprint arXiv:2604.19775},
year = {2026}
}
备注
12 pages, 3 figures