如何解释智能体行为
人工智能
2026-05-14 v1
摘要
诠释像Claude Code和Codex等自主智能体的运行行为已成为诊断不效率、修复错误以及确保更好监控的关键任务。获取这种理解的主要方式是分析这些智能体生成的推理轨迹和执行痕迹。然而,这些数据仍以非结构化自然语言形式存在,使得在规模上难以被人类解读。我们引入ACT*ONOMY (行动与分类学组合),用于描述和分析智能体运行时行为的分类学。ACT*ONOMY包含两个组成部分:(1) 通过 grounding theory 开发的分类学本身,作为由10个动作、46个子动作和120个叶类别构成的三级层次结构; (2) 一个开放式存储库,托管活跃分类学,提供应用于智能体轨迹分析的自动化分析管道,并定义用于自定义和增长的扩展协议。我们的实验表明,ACT*ONOMY可以比较不同智能体的行为轮廓,并描述单个智能体在不同轨迹中的行为,揭示表明故障模式的模式。通过提供共享词汇表,ACT*ONOMY帮助研究人员、智能体设计师和最终用户更一致地解释智能体行为,从而实现更好的监控和控制。
引用
@article{arxiv.2605.13625,
title = {How to Interpret Agent Behavior},
author = {Jie Gao and Kaiser Sun and Jen-tse Huang and Katherine Van Koevering and Sijie Ji and Heyuan Huang and Weiyan Shi and Zhuoran Lu and Ziang Xiao and Daniel Khashabi and Mark Dredze},
journal= {arXiv preprint arXiv:2605.13625},
year = {2026}
}
备注
34 pages in total