中文

LLM 智能体对其世界了解多少?Task2Quiz:一种研究环境理解的范式

人工智能 2026-01-15 v1

摘要

大型语言模型(LLM)智能体在复杂的决策和工具使用任务中展现了卓越的能力,然而它们在不同环境中的泛化能力仍然是一个未被充分审视的问题。当前的评估范式主要依赖于基于轨迹的指标来衡量任务成功,却未能评估智能体是否拥有一个扎实的、可迁移的环境模型。为了解决这一差距,我们提出了 Task-to-Quiz(T2Q),这是一种确定性的自动化评估范式,旨在将任务执行与世界状态理解解耦。我们在 T2QBench 中实例化了这一范式,该基准套件包含 30 个环境和 1967 个跨多个难度级别的扎实问答对。我们广泛的实验表明,任务成功往往是环境理解的一个糟糕的代理指标,并且当前的记忆机制无法有效帮助智能体获得扎实的环境模型。这些发现将主动探索和细粒度状态表征确定为主要瓶颈,为开发更具泛化能力的自主智能体提供了坚实的基础。

关键词

引用

@article{arxiv.2601.09503,
  title  = {What Do LLM Agents Know About Their World? Task2Quiz: A Paradigm for Studying Environment Understanding},
  author = {Siyuan Liu and Hongbang Yuan and Xinze Li and Ziyue Zhu and Yixin Cao and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2601.09503},
  year   = {2026}
}