中文

LEO-VL: 可扩展3D视觉语言学习的高效场景表示

计算机视觉与模式识别 2026-03-24 v3

摘要

开发能够理解3D场景的视觉语言模型(VLM)是一个长期的研究目标。尽管近期取得了进展,3D VLM仍然在空间推理和鲁棒性方面存在困难。我们识别出三个阻碍其进步的关键障碍:(1) 场景表示受限于容量-效率权衡,阻碍了可扩展学习;(2) 训练数据缺乏全面的方案,在任务和场景领域上多样性有限;(3) 模型存在鲁棒性缺陷且缺乏有效的后训练。为解决这些挑战,我们首先提出压缩特征网格(CFG),一种高效的场景表示,在显著减少标记开销的同时保持了强大的感知能力。基于CFG,我们引入LEO-VL,一个在超过700k个3D视觉语言(3D-VL)数据上训练的3D VLM,涵盖四个真实室内领域和五个任务,如描述和对话。为进一步提高鲁棒性,我们提出SceneDPO,一种新颖的后训练目标,融合了答案和场景两端的对比信号。LEO-VL在各种3D-VL基准上取得了最先进性能,如SQA3D、Beacon3D和Scan2Cap。广泛的分析突出了CFG的效率,并提供了关键洞见,如任务和场景多样性的重要性、数据质量对有效扩展的优先级以及SceneDPO的优势。

关键词

引用

@article{arxiv.2506.09935,
  title  = {LEO-VL: Efficient Scene Representation for Scalable 3D Vision-Language Learning},
  author = {Jiangyong Huang and Xiaojian Ma and Xiongkun Linghu and Junchao He and Qing Li and Song-Chun Zhu and Yixin Chen and Baoxiong Jia and Siyuan Huang},
  journal= {arXiv preprint arXiv:2506.09935},
  year   = {2026}
}

备注

Project page: https://leo-vl.github.io