City-VLM: 基于多模态不完整学习的多域感知场景理解
计算机视觉与模式识别
2025-07-18 v1 人工智能
摘要
场景理解使智能体能够解释和理解其环境。虽然现有的大型视觉-语言模型(LVM)用于场景理解主要聚焦于室内家庭任务,但在应用于户外大规模场景理解时面临两个显著限制。首先,户外场景通常包含通过各种传感器从多个视角观察的大规模环境(例如鸟瞰视角和陆地视角),而现有的室内LVM主要在建筑规模的上下文中从人类化视角分析单一视觉模态。其次,现有的LVM缺乏户外多域感知数据且难以有效整合2D和3D视觉信息。为此,我们构建了第一个多域感知户外场景理解数据集,命名为\textbf{\underline{SVM-City}},源自多\textbf{\textbf{S}}cale情景下的多\textbf{\textbf{V}}iew与多\textbf{\textbf{M}}odal指令调谐数据。数据集包含 张图片和 百万点云,配有 问答对,来自车辆、低空无人机、高空航空飞机和卫星。为有效融合缺失单一模态中的多模态数据,我们引入不完整多模态学习以建模户外场景理解并设计名为\textbf{\underline{City-VLM}}的LVM。通过构建联合概率分布空间来实现多模态融合,而非直接实施显式融合操作(如拼接)。在三个典型户外场景理解任务上的实验结果显示,City-VLM在问答任务中平均实现了 的性能提升。该方法在多个户外场景中表现出务实且广泛的泛化性能。
引用
@article{arxiv.2507.12795,
title = {City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning},
author = {Penglei Sun and Yaoxian Song and Xiangru Zhu and Xiang Liu and Qiang Wang and Yue Liu and Changqun Xia and Tiefeng Li and Yang Yang and Xiaowen Chu},
journal= {arXiv preprint arXiv:2507.12795},
year = {2025}
}