中文

DynamicVL:面向动态城市理解的多模态大型语言模型基准测试

计算机视觉与模式识别 2025-10-28 v2

摘要

多模态大型语言模型(MLLM)在视觉理解方面展现出了卓越的能力,但其在长期地球观测分析中的应用仍然有限,主要集中在单时相或双时相图像上。为了填补这一空白,我们引入了 DVL-Suite,这是一个通过遥感影像分析长期城市动态的综合框架。该套件包含 14,871 张高分辨率(1.0m)多时相图像,涵盖了 2005 年至 2023 年间美国 42 个主要城市,分为两个部分:DVL-Bench 和 DVL-Instruct。DVL-Bench 包含六项城市理解任务,从基础的变化检测(像素级)到定量分析(区域级)和综合城市叙述(场景级),捕捉了包括扩张/转型模式、灾害评估和环境挑战在内的多种城市动态。我们评估了 18 个 SOTA MLLM,揭示了它们在长期时间理解和定量分析方面的局限性。这些挑战促使我们创建了 DVL-Instruct,这是一个专门的指令微调数据集,旨在增强模型在多时相地球观测中的能力。基于该数据集,我们开发了 DVLChat,这是一个能够同时进行图像级问答和像素级分割的基线模型,通过语言交互促进对城市动态的全面理解。

关键词

引用

@article{arxiv.2505.21076,
  title  = {DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding},
  author = {Weihao Xuan and Junjue Wang and Heli Qi and Zihang Chen and Zhuo Zheng and Yanfei Zhong and Junshi Xia and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2505.21076},
  year   = {2025}
}

备注

NeurIPS 2025