中文

TriEx:一种基于博弈的多智能体大语言模型内部推理三视图解释框架

计算与语言 2026-04-23 v1 人工智能

摘要

在交互式、部分可观测的环境中,决策依赖于不断演化的信念和其他智能体,这使得大语言模型(LLM)智能体的可解释性尤为困难。我们提出 TriEx,一个三视图可解释性框架,通过以下对齐的产物来解析序列决策过程:(i) 与动作绑定的结构化第一人称自我推理,(ii) 随时间更新的关于对手的显式第二人称信念状态,以及 (iii) 基于环境衍生参考信号的第三人称神谕审计。这种设计将解释从自由形式的叙述转变为基于证据的对象,这些对象可以跨时间和跨视角进行比较和核查。我们使用不完全信息策略博弈作为受控测试平台,展示了 TriEx 能够对解释忠实度、信念动态和评估者可靠性进行可扩展分析,揭示了智能体所言、所信与所为之间的系统性不匹配。我们的结果强调了可解释性是一种依赖于交互的属性,并推动了针对 LLM 智能体的多视图、基于证据的评估。代码可在 https://github.com/Einsam1819/TriEx 获取。

关键词

引用

@article{arxiv.2604.20043,
  title  = {TriEx: A Game-based Tri-View Framework for Explaining Internal Reasoning in Multi-Agent LLMs},
  author = {Ziyi Wang and Chen Zhang and Wenjun Peng and Qi Wu and Xinyu Wang},
  journal= {arXiv preprint arXiv:2604.20043},
  year   = {2026}
}

备注

ACL2026 Main