中文

BALROG:基于游戏评估智能代理 LLM 和 VLM 推理能力

人工智能 2025-04-02 v2

摘要

大型语言模型 (LLM) 和视觉语言模型 (VLM) 拥有广泛的知识储备并表现出有前景的推理能力,但在复杂动态环境中仍表现不佳。现实任务需要处理复杂交互、先进空间推理、长期计划以及持续探索新策略——这些能力缺乏有效的评估方法。为填补这一空白,我们引入 BALROG,这是一个通过多样化具有挑战性的游戏来评估 LLM 和 VLM 智能代理能力的新型基准测试。我们的基准测试整合了不同难度级别的强化学习环境,包括易于非专家在数秒内解决的任务到可能需要数年才能掌握的极具挑战性任务(如 NetHack 学习环境)。我们设计了细粒度指标来衡量性能,并对多种主流开源和闭源 LLM 和 VLM 进行了广泛评估。我们的发现表明,虽然当前模型在较简单游戏中取得部分成功,但在更具挑战性的任务中表现显著不足。值得注意的是,我们观察到视觉决策存在严重缺陷,多个模型在提供环境视觉表征时表现得更差。我们将 BALROG 作为开放且用户友好的基准测试发布,以促进智能代理社区的未来研究与发展。代码和排行榜可访问 balrogai.com。

关键词

引用

@article{arxiv.2411.13543,
  title  = {BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games},
  author = {Davide Paglieri and Bartłomiej Cupiał and Samuel Coward and Ulyana Piterbarg and Maciej Wolczyk and Akbir Khan and Eduardo Pignatelli and Łukasz Kuciński and Lerrel Pinto and Rob Fergus and Jakob Nicolaus Foerster and Jack Parker-Holder and Tim Rocktäschel},
  journal= {arXiv preprint arXiv:2411.13543},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025