UrBench:面向多视角城市场景下大型多模态模型评估的综合基准
计算机视觉与模式识别
2025-03-11 v3 人工智能
摘要
近期对大型多模态模型(LMMs)的评估探索了其在各个领域的能力,但专门针对城市环境的基准测试寥寥无几。此外,现有的城市基准测试仅限于在单一视角下评估 LMMs 执行基本区域级城市任务的能力,导致对 LMMs 在城市环境中能力的评估不完整。为了解决这些问题,我们提出了 UrBench,这是一个旨在评估 LMMs 在复杂多视角城市场景中能力的综合基准。UrBench 包含 11.6K 个精心策划的区域级和角色级问题,涵盖 4 个任务维度:地理定位、场景推理、场景理解和物体理解,共计 14 种任务类型。在构建 UrBench 时,我们利用了现有数据集的数据,并额外收集了来自 11 个城市的数据,使用跨视角检测匹配方法创建了新的标注。利用这些图像和标注,我们随后整合了基于 LMM、基于规则和基于人类的方法来构建大规模高质量问题。我们对 21 个 LMMs 的评估表明,当前的 LMMs 在城市环境的若干方面仍面临困难。即使是表现最好的 GPT-4o 在大多数任务上也落后于人类,从简单的计数任务到复杂的方位、定位和物体属性识别任务,平均性能差距为 17.4%。我们的基准测试还表明,LMMs 在不同的城市视角下表现出不一致的行为,尤其是在理解跨视角关系方面。
引用
@article{arxiv.2408.17267,
title = {UrBench: A Comprehensive Benchmark for Evaluating Large Multimodal Models in Multi-View Urban Scenarios},
author = {Baichuan Zhou and Haote Yang and Dairong Chen and Junyan Ye and Tianyi Bai and Jinhua Yu and Songyang Zhang and Dahua Lin and Conghui He and Weijia Li},
journal= {arXiv preprint arXiv:2408.17267},
year = {2025}
}
备注
9 pages, 6 figures