GameplayQA:面向决策密集型POV同步多视频理解的3D虚拟智能体基准框架
计算与语言
2026-04-14 v2 人工智能
计算机视觉与模式识别
摘要
多模态大语言模型(Multimodal LLMs)日益被用于作为3D环境中自主智能体的感知 backbone,涵盖从机器人到虚拟世界的应用。这些应用要求智能体从一垂直视角感知快速状态变化,正确归因于具体实体,并推理并发的多智能体行为,这些能力当前基准测试不足以评估。我们引入GameplayQA,通过视频理解评估以智能体为中心的感知与推理。具体而言,我们以每秒1.22个标签的密集标注格式,对多人3D游戏视频进行标注,采用与自我(Self)、其他智能体(Other Agents)和世界(World)三元系统结构化的并列标题,对状态、动作和事件进行时间同步标注。基于这些标注,我们精炼出2.4K个诊断性QA对,组织为三个认知复杂度层级,并配以结构化干扰项分类,以实现对模型幻觉的细粒度分析。评估前沿MLLM表现显示,其与人类水平之间存在显著鸿沟,常见故障包括时序与跨视频 grounding、智能体角色归因以及处理游戏决策密度方面的问题。我们希望GameplayQA能刺激具身AI、智能体感知与世界建模领域的后续研究。
引用
@article{arxiv.2603.24329,
title = {GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents},
author = {Yunzhe Wang and Runhui Xu and Kexin Zheng and Tianyi Zhang and Jayavibhav Niranjan Kogundi and Soham Hans and Volkan Ustun},
journal= {arXiv preprint arXiv:2603.24329},
year = {2026}
}
备注
Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)