中文

City-VLM: 基于多模态不完整学习的多域感知场景理解

计算机视觉与模式识别 2025-07-18 v1 人工智能

摘要

场景理解使智能体能够解释和理解其环境。虽然现有的大型视觉-语言模型(LVM)用于场景理解主要聚焦于室内家庭任务,但在应用于户外大规模场景理解时面临两个显著限制。首先,户外场景通常包含通过各种传感器从多个视角观察的大规模环境(例如鸟瞰视角和陆地视角),而现有的室内LVM主要在建筑规模的上下文中从人类化视角分析单一视觉模态。其次,现有的LVM缺乏户外多域感知数据且难以有效整合2D和3D视觉信息。为此,我们构建了第一个多域感知户外场景理解数据集,命名为\textbf{\underline{SVM-City}},源自多\textbf{\textbf{S}}cale情景下的多\textbf{\textbf{V}}iew与多\textbf{\textbf{M}}odal指令调谐数据。数据集包含 420k420k 张图片和 4,8114, 811 百万点云,配有 567k567k 问答对,来自车辆、低空无人机、高空航空飞机和卫星。为有效融合缺失单一模态中的多模态数据,我们引入不完整多模态学习以建模户外场景理解并设计名为\textbf{\underline{City-VLM}}的LVM。通过构建联合概率分布空间来实现多模态融合,而非直接实施显式融合操作(如拼接)。在三个典型户外场景理解任务上的实验结果显示,City-VLM在问答任务中平均实现了 18.1418.14% 的性能提升。该方法在多个户外场景中表现出务实且广泛的泛化性能。

关键词

引用

@article{arxiv.2507.12795,
  title  = {City-VLM: Towards Multidomain Perception Scene Understanding via Multimodal Incomplete Learning},
  author = {Penglei Sun and Yaoxian Song and Xiangru Zhu and Xiang Liu and Qiang Wang and Yue Liu and Changqun Xia and Tiefeng Li and Yang Yang and Xiaowen Chu},
  journal= {arXiv preprint arXiv:2507.12795},
  year   = {2025}
}