StarBench:面向智能体多模态决策与信息检索的回合制 RPG 基准
人工智能
2025-10-22 v1
摘要
人类玩家的行为远不止按按钮那么简单:他们会将屏幕上看到的内容 grounding 到具体的键盘和鼠标动作上,并在卡住时主动寻求信息后再尝试。我们询问当前的视觉语言模型(VLM)是否能够做到同样的事。尽管在简化的控制环境或工具 scaffold 下取得了鼓舞人心的成果,但在真实客户端中实现类人游戏——将原始屏幕截图映射到具有时序性的低层动作,同时决定何时寻求帮助——仍是一个未解决的挑战。我们介绍 StarBench,这是一个源自《崩坊:星轨》(Honkai: Star Rail)的回合制 RPG 基准测试,旨在针对这两项类人能力:从像素到动作的多模态决策和智能体信息检索。StarBench 横跨八个战斗任务和两个实验 regime,统一使用共享任务和评估指标:(i) 直接控制模式下,智能体仅接收屏幕截图,必须输出低层原始动作(点击和按键),且无任何语义线索;(ii) 工具辅助控制模式下,允许将高层意图映射到原始动作,OCR 输出提供可选的文本化观察, easing UI grounding。为模拟人类实践,StarBench 还包含一个 ask-or-act 诊断工具,衡量智能体在行动前是否选择请求简要指导,以及这种选择对后续表现的影响。我们报告了当代 VLM 的参考基线以及人类参考结果。结果显示直接控制模式下感知到控制的保真度存在显著差距,同时表明恰当的信息检索与提升成功率呈正相关,确立了 StarBench 作为智能体信息检索和真实客户端中多模态决策可重复基准的地位。
引用
@article{arxiv.2510.18483,
title = {StarBench: A Turn-Based RPG Benchmark for Agentic Multimodal Decision-Making and Information Seeking},
author = {Haoran Zhang and Chenhao Zhu and Sicong Guo and Hanzhe Guo and Haiming Li and Donglin Yu},
journal= {arXiv preprint arXiv:2510.18483},
year = {2025}
}