DynamicVL:面向动态城市理解的多模态大型语言模型基准测试
计算机视觉与模式识别
2025-10-28 v2
摘要
多模态大型语言模型(MLLM)在视觉理解方面展现出了卓越的能力,但其在长期地球观测分析中的应用仍然有限,主要集中在单时相或双时相图像上。为了填补这一空白,我们引入了 DVL-Suite,这是一个通过遥感影像分析长期城市动态的综合框架。该套件包含 14,871 张高分辨率(1.0m)多时相图像,涵盖了 2005 年至 2023 年间美国 42 个主要城市,分为两个部分:DVL-Bench 和 DVL-Instruct。DVL-Bench 包含六项城市理解任务,从基础的变化检测(像素级)到定量分析(区域级)和综合城市叙述(场景级),捕捉了包括扩张/转型模式、灾害评估和环境挑战在内的多种城市动态。我们评估了 18 个 SOTA MLLM,揭示了它们在长期时间理解和定量分析方面的局限性。这些挑战促使我们创建了 DVL-Instruct,这是一个专门的指令微调数据集,旨在增强模型在多时相地球观测中的能力。基于该数据集,我们开发了 DVLChat,这是一个能够同时进行图像级问答和像素级分割的基线模型,通过语言交互促进对城市动态的全面理解。
引用
@article{arxiv.2505.21076,
title = {DynamicVL: Benchmarking Multimodal Large Language Models for Dynamic City Understanding},
author = {Weihao Xuan and Junjue Wang and Heli Qi and Zihang Chen and Zhuo Zheng and Yanfei Zhong and Junshi Xia and Naoto Yokoya},
journal= {arXiv preprint arXiv:2505.21076},
year = {2025}
}
备注
NeurIPS 2025