中文

LSceneLLM:利用自适应视觉偏好提升大规模 3D 场景理解

计算机视觉与模式识别 2025-02-04 v2

摘要

3D 视觉语言模型(3D-VLMs)的研究正日益受到关注,这对于开发基于 3D 场景的具身 AI 至关重要,例如视觉导航和具身问答。由于视觉特征的密度很高,尤其是在大型 3D 场景中,准确定位任务相关视觉信息具有挑战性。现有工作尝试对所有对象进行分割并将其特征视为场景表示。然而,这些对任务不敏感的对象特征包含大量冗余信息,并且在任务相关区域缺乏细节。为解决这些问题,我们提出了LSceneLLM,一种自适应框架,通过利用 LLM 对不同任务的视觉偏好来自动识别任务相关区域,然后通过一个即插即用的场景放大模块来捕获聚焦区域的细粒度细节。具体而言,一个稠密 token 选择器检查 LLM 的注意力图以识别指令输入的视觉偏好,然后放大聚焦区域的细粒度细节。我们引入自适应自注意力模块来融合粗粒度和选定的细粒度视觉信息。为全面评估 3D-VLMs 的大规模场景理解能力,我们进一步引入了一个跨房间理解基准,XR-Scene,其中包含XR-QA、XR-EmbodiedPlanning 和 XR-SceneCaption 等大规模场景理解任务。实验表明,我们的方法在大规模场景理解和现有场景理解基准上均优于现有方法。将我们的场景放大模块植入现有 3D-VLMs 也可带来显著的改进。

关键词

引用

@article{arxiv.2412.01292,
  title  = {LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences},
  author = {Hongyan Zhi and Peihao Chen and Junyan Li and Shuailei Ma and Xinyu Sun and Tianhang Xiang and Yinjie Lei and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2412.01292},
  year   = {2025}
}