中文

AgentVista:用于评估极具挑战性真实场景中多模态智能体

计算机视觉与模式识别 2026-03-03 v2

摘要

现实世界的多模态智能体通过视觉证据解决多步骤工作流程。例如,智能体可通过将接线照片与原理图关联,并借助在线文档验证修复结果来排除故障,或通过解读交通图并在路径约束下检查时刻表来规划旅行。然而,现有多模态基准主要评估单轮视觉推理或特定工具技能,未能充分捕捉实际智能体所需的真实性、视觉细微性以及长期限定工具使用的特征。我们提出 AgentVista,一个覆盖 25 个子领域、分为 7 大类的通用多模态智能体基准,构建了具备真实性和细节丰富性的视觉场景与自然混合工具使用的匹配。任务要求跨模态的长期限定工具交互,包括网页搜索、图像搜索、页面浏览和用于图像处理和通用编程的代码操作。对最新模型的全面评估揭示了在 carrying out 长期跨模态工具使用方面存在显著差距。即使在我们评估中表现最好的 Gemini-3-Pro 配备工具,整体准确率也仅为 27.3%,且难题实例可能需要超过 25 次工具调用。我们期望 AgentVista 加速开发更具能力和可靠性的多模态智能体,以应对真实且极具挑战性的问题解决。

关键词

引用

@article{arxiv.2602.23166,
  title  = {AgentVista: Evaluating Multimodal Agents in Ultra-Challenging Realistic Visual Scenarios},
  author = {Zhaochen Su and Jincheng Gao and Hangyu Guo and Zhenhua Liu and Lueyang Zhang and Xinyu Geng and Shijue Huang and Peng Xia and Guanyu Jiang and Cheng Wang and Yue Zhang and Yi R. Fung and Junxian He},
  journal= {arXiv preprint arXiv:2602.23166},
  year   = {2026}
}

备注

The project website is available at https://agentvista-bench.github.io/, and the code is available at https://github.com/hkust-nlp/AgentVista