中文

FlashAdventure:一个用于测试 GUI 智能体解决多样化冒险游戏完整故事线的基准

人工智能 2025-10-16 v2 计算与语言 计算机视觉与模式识别

摘要

由大语言模型 (LLM) 驱动的图形用户界面 (GUI) 智能体在与多样化的数字环境交互方面展现出潜力。其中,电子游戏因其多样的界面而成为一个有价值的测试平台,而冒险游戏则通过复杂的、叙事驱动的交互带来了额外的挑战。然而,现有的游戏基准缺乏多样性,并且很少评估智能体完成整个故事情节的能力。为解决这一问题,我们引入了 FlashAdventure,一个包含 34 款基于 Flash 的冒险游戏的基准,旨在测试完整故事线的完成情况,并解决观察-行为差距:即记住并依据早期游戏信息采取行动的挑战。我们还提出了 CUA-as-a-Judge,一种自动化的游戏过程评估器,以及 COAST,一个利用长期线索记忆来更好地规划和解决顺序任务的智能体框架。实验表明,当前的 GUI 智能体在完整故事线上表现挣扎,而 COAST 通过弥合观察-行为差距提高了里程碑完成率。尽管如此,人类与表现最佳的智能体之间仍存在显著差距,这需要持续的研究努力来缩小这一鸿沟。

关键词

引用

@article{arxiv.2509.01052,
  title  = {FlashAdventure: A Benchmark for GUI Agents Solving Full Story Arcs in Diverse Adventure Games},
  author = {Jaewoo Ahn and Junseo Kim and Heeseung Yun and Jaehyeon Son and Dongmin Park and Jaewoong Cho and Gunhee Kim},
  journal= {arXiv preprint arXiv:2509.01052},
  year   = {2025}
}

备注

EMNLP 2025 Main. Project page: https://ahnjaewoo.github.io/flashadventure