Argus:利用多视图图像提升基于大语言模型的3D场景理解
计算机视觉与模式识别
2025-07-18 v1 人工智能
摘要
基础模型的进步使得能够在各种下游任务中进行应用。尤其值得注意的是,新时代已经展现出将大语言模型(LLM)扩展到3D场景理解任务的显著能力。当前方法高度依赖3D点云,但室内场景的3D点云重建常导致信息丢失。某些纹理less平面或重复图案容易被遗漏,表现为重建的3D点云中的空洞。此外,具有复杂结构的物体会因捕获的图像与稠密重建点云之间的错位而导致细节失真。2D多视图图像与3D点云在视觉上保持一致,并提供场景组成部分的更详细表征,能够自然地补偿这些缺陷。基于这些见解,我们提出了Argus,一种新颖的3D多模态框架,利用多视图图像与LLM协同实现更好的3D场景理解。总体而言,Argus可以作为一种3D大型多模态基础模型(3D-LMM),因为它接受 various 模式作为输入(文本指令、2D多视图图像和3D点云),并扩展了LLM处理3D任务的能力。Argus涉及将多视图图像和相机姿态融合整合为视角-场景特征,这些特征与3D特征相互作用,以创建全面且详尽的3D感知场景嵌入。我们的方法在重建3D点云时补偿了信息丢失,并帮助LLM更好地理解3D世界。大量实验表明,我们的方法在各种下游任务中超越了现有的3D-LMMs。
引用
@article{arxiv.2507.12916,
title = {Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models},
author = {Yifan Xu and Chao Zhang and Hanqi Jiang and Xiaoyan Wang and Ruifei Ma and Yiwei Li and Zihao Wu and Zeju Li and Xiangde Liu},
journal= {arXiv preprint arXiv:2507.12916},
year = {2025}
}
备注
Accepted by TNNLS2025