中文

语言模型智能体目标导向性的行为与表征评估

机器学习 2026-02-10 v1 人工智能 计算与语言 计算机与社会

摘要

理解智能体的目标有助于解释和预测其行为,但目前尚无可靠归因于智能体系统的评估方法。我们提出了一个集成行为评估与解释性分析模型内部表征的框架,用于评估目标导向性。作为案例研究,我们检查一个 LLM 智能体在 2D 网格世界中导航以到达目标状态。行为上,我们将智能体对抗不同网格大小、障碍密度和目标结构下的最优策略进行评估,发现性能随任务难度而扩展,但对难度保持转换和复杂目标结构仍然稳健。随后,我们使用探测方法解码智能体内部的环境状态表征及其多步行动计划。我们发现 LLM 智能体非线性地对环境进行粗糙的空间编码,保留关于其位置和目标位置的近似任务相关线索;其行为与这些内部表征大致一致;推理还会重新组织这些表征,使其从更广泛的环境结构线索转向支持立即行动选择的信息。我们的发现支持进一步通过自省检查来特征化智能体如何表示和追求其目标的观点。

关键词

引用

@article{arxiv.2602.08964,
  title  = {A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents},
  author = {Raghu Arghal and Fade Chen and Niall Dalton and Evgenii Kortukov and Calum McNamara and Angelos Nalmpantis and Moksh Nirvaan and Gabriele Sarti and Mario Giulianelli},
  journal= {arXiv preprint arXiv:2602.08964},
  year   = {2026}
}