Reg3D:面向3D场景理解的重构几何指令调优
计算机视觉与模式识别
2025-09-05 v1
摘要
大型多模态模型(LMM)的快速发展导致在2D视觉理解方面取得了显著进展;然而,将这些能力扩展到3D场景理解仍然是一个重大挑战。现有方法主要依赖文本-only监督,无法为学习稳健的3D空间表示提供几何约束。本文介绍了Reg3D,这是一种新的重构几何指令调优框架,用于解决这一限制。我们的关键洞察是,有效的3D理解需要重建底层几何结构,而不仅仅是描述它们。不同于仅在输入层注入3D信息的现有方法,Reg3D采用双监督范式,直接将3D几何信息用作输入和显式学习目标。具体而言,我们在双编码器架构中设计了互补的对象级和帧级重建任务,以强制几何一致性,以鼓励发展空间推理能力。在ScanQA、Scan2Cap、ScanRefer和SQA3D上的大规模实验表明,Reg3D实现了显著的性能提升,确立了一种新的空间感知多模态模型训练范式。
引用
@article{arxiv.2509.03635,
title = {Reg3D: Reconstructive Geometry Instruction Tuning for 3D Scene Understanding},
author = {Hongpei Zheng and Lintao Xiang and Qijun Yang and Qian Lin and Hujun Yin},
journal= {arXiv preprint arXiv:2509.03635},
year = {2025}
}
备注
16 pages, 6 figures