中文

Video-3D LLM: 用于3D场景理解的位置感知视频表示学习

计算机视觉与模式识别 2025-03-28 v2 计算与语言

摘要

多模态大语言模型(MLLM)的快速发展显著推动了 various 多模态任务的应用。然而,这些模型在需要理解3D环境中空间结构的任务面临挑战。虽然通过融合点云特征来增强MLLM的努力已有所尝试,但模型所学表征与3D场景内在复杂性之间仍存在显著差距。这一差距很大程度上源于MLLM在主要针对2D数据进行训练,限制了其有效理解3D空间的能力。为此,本文提出一种新型通用模型,即Video-3D LLM,用于3D场景理解。将3D场景视为动态视频,并将3D位置编码融入这些表征后,Video-3D LLM能够更准确地将视频表征与真实世界的空间语境对齐。此外,我们实现了一种最大覆盖率采样技术,以优化计算成本与性能之间的权衡。大量实验表明,我们的模型在多个3D场景理解基准测试上实现了最先进的性能,包括ScanRefer、Multi3DRefer、Scan2Cap、ScanQA和SQA3D。

关键词

引用

@article{arxiv.2412.00493,
  title  = {Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding},
  author = {Duo Zheng and Shijia Huang and Liwei Wang},
  journal= {arXiv preprint arXiv:2412.00493},
  year   = {2025}
}

备注

Accepted by CVPR 2025