PokeGym:面向视觉语言模型的视觉驱动长期程度基准
计算机视觉与模式识别
2026-04-10 v1 人工智能
摘要
尽管视觉语言模型 (Vision-Language Models, VLM) 在静态视觉理解方面取得了显著进展,但其在复杂三维具身环境中的部署仍受到严重限制。现有基准存在四个关键缺陷:(1) 被动感知任务规避了互动动力學;(2) 简化的二维环境无法评估深度感知;(3) 特权状态泄漏绕过了真正的视觉处理;(4) 人类评估成本高昂且难以扩展。我们引入 PokeGym,一个基于 Pokemon Legends: Z-A 的视觉驱动长期程度基准。PokeGym 强制执行严格的代码级隔离:智能体仅通过原始 RGB 观察操作,独立的评估器通过记忆扫描验证成功,确保纯粹的基于视觉的决策制定和自动化、可扩展的评估。该基准包含 30 项任务(30-220 步),涵盖导航、交互与混合场景,三种指令粒度 (Visual-Guided、Step-Guided、Goal-Only) 用于系统性解构视觉定位、语义推理与自主探索能力。我们的评估揭示了当前 VLM 的关键限制:物理死锁恢复,而非高层规划,是主要瓶颈,死锁与任务成功率呈强负相关。此外,我们发现了元认知分歧:较弱的模型主要受无意识死锁 (oblivious to entrapment) 影响,而高级模型表现出意识到死锁但无法恢复的死锁 (Aware Deadlocks)。这些发现凸显了将显式空间直觉集成到 VLM 架构中的必要性。该代码和基准将在 GitHub 上提供。
引用
@article{arxiv.2604.08340,
title = {PokeGym: A Visually-Driven Long-Horizon Benchmark for Vision-Language Models},
author = {Ruizhi Zhang and Ye Huang and Yuangang Pan and Chuanfu Shen and Zhilin Liu and Ting Xie and Wen Li and Lixin Duan},
journal= {arXiv preprint arXiv:2604.08340},
year = {2026}
}
备注
Tech report