谁看到了什么?面向大语言模型认知推理的结构化思维-动作序列
人工智能
2025-08-21 v1 计算与语言
人机交互
摘要
大语言模型(LLM)和推理框架的最新进展为提升自主智能体的视角采择能力开辟了新的可能性。然而,涉及主动感知、协作推理和视角采择(理解另一个智能体能看到什么或知道什么)的任务对当前基于LLM的系统构成了持续挑战。本研究探讨了由Fast Downward规划器生成的转换解图所派生的结构化示例,在ReAct框架内提升基于LLM的智能体性能的潜力。我们提出一个结构化解处理流水线,生成三类不同的示例:最优目标路径(G型)、信息节点路径(E型)以及对比替代动作的逐步最优决策序列(L型)。这些解通过提示LLM明确阐述每个决策背后的推理,进一步转换为“思维-动作”示例。虽然L型示例略微减少了澄清请求和总体动作步骤,但并未带来一致的改进。智能体在需要基本注意力过滤的任务中表现成功,但在需要推理遮挡空间或权衡认知动作成本的场景中表现挣扎。这些发现表明,仅靠结构化示例不足以实现稳健的视角采择,这凸显了在基于LLM的智能体中实现社会性协作,需要显式的信念追踪、成本建模和更丰富的环境。
引用
@article{arxiv.2508.14564,
title = {Who Sees What? Structured Thought-Action Sequences for Epistemic Reasoning in LLMs},
author = {Luca Annese and Sabrina Patania and Silvia Serino and Tom Foulsham and Silvia Rossi and Azzurra Ruggeri and Dimitri Ognibene},
journal= {arXiv preprint arXiv:2508.14564},
year = {2025}
}
备注
Accepted at ICSR25