中文

3DCity-LLM:面向 3D 城市尺度感知的多模态大语言模型

计算机视觉与模式识别 2026-03-25 v1 人工智能

摘要

虽然多模态大语言模型在基于对象的或室内场景中表现出色,但将其扩展到 3D 城市尺度环境仍面临巨大挑战。为弥合这一差距,我们提出 3DCity-LLM,一个为 3D 城市尺度视觉语言感知与理解设计的统一框架。3DCity-LLM 采用粗到细特征编码策略,包含三个平行分支用于目标对象、对象间关系和全局场景。为 facilitate 大规模训练,我们引入 3DCity-LLM-1.2M 数据集,包含约 120 万个高质量样本,覆盖七个典型任务类别,从细粒度对象分析到多方位场景规划。该严格控制质量的数据集集成了显式 3D 数值信息和多样化用户导向的仿真,丰富了城市场景中问答多样性和真实性。此外,我们应用基于文本相似性度量和 LLM 基于语义评估的多维协议,确保所有方法的忠实性和全面性评估。在两个基准上的大量实验表明,3DCity-LLM 显著优于现有最先进方法,为推进空间推理和城市智能提供了有前景且有意义的方向。源代码和数据集可在 https://github.com/SYSU-3DSTAILab/3D-City-LLM 获取。

关键词

引用

@article{arxiv.2603.23447,
  title  = {3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding},
  author = {Yiping Chen and Jinpeng Li and Wenyu Ke and Yang Luo and Jie Ouyang and Zhongjie He and Li Liu and Hongchao Fan and Hao Wu},
  journal= {arXiv preprint arXiv:2603.23447},
  year   = {2026}
}

备注

24 pages, 11 figures, 12 tables