HMR3D:面向大规模视觉语言模型的3D场景分层多模态表示
计算机视觉与模式识别
2025-12-01 v1
摘要
近期大规模视觉语言模型(Large Vision-Language Model, VLM)的进展显示出巨大的潜力用于3D场景理解。现有的 VLM 基于方法通常通过对齐3D场景特征与 VLM 的嵌入空间来实现,但这种隐式对齐往往导致性能次优,这源于3D数据的稀缺以及3D环境中空间关系的内在复杂性。为此,我们提出了一种用于3D场景推理的分层多模态表示,该表示通过利用多视角图像和文本描述在输入空间显式对齐 VLM。文本描述通过引用检测到的物体的3D坐标来捕获空间关系,而多视角图像包括俯视视角和四个方向视角(前、左、右、后),确保对场景的全面覆盖。此外,我们引入了分层特征表示,该表示将patch级图像特征聚合为视角级和场景级表示,使模型能够在局部和全局场景上下文之间进行推理。实验结果在两个3D问答基准(situated 3D Q&A 和 general 3D Q&A)上均显示出我们方法的有效性。
引用
@article{arxiv.2511.22961,
title = {HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model},
author = {Chen Li and Eric Peh and Basura Fernando},
journal= {arXiv preprint arXiv:2511.22961},
year = {2025}
}