中文

Pts3D-LLM:探讨3D场景理解中标记结构的影响

计算机视觉与模式识别 2025-06-09 v1

摘要

有效地为多模态大语言模型(MLLMs)表示3D场景至关重要且具有挑战性。现有方法通常仅依赖2D图像特征并采用多种标记化方法。本工作对3D标记结构进行了严格的研究,系统比较了基于视频和基于点的表示方法,同时保持一致的模型骨干和参数。我们提出了一种新方法,通过融合来自Sonata预训练的Point Transformer V3编码器的3D点云特征来丰富视觉标记。我们的实验表明,融合显式3D特征显著提升了性能。进一步地,我们展示了当点被巧妙采样和排序后,基于点的标记结构可以与基于视频的标记结构不相上下。我们的方法的最佳模型在多个3D理解基准测试中均实现了最先进的成绩。我们强调将标记结构作为关键贡献,以及透明报告多个随机种子平均结果的实践,我们认为这对该领域的稳健进步至关重要。

关键词

引用

@article{arxiv.2506.05689,
  title  = {Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models},
  author = {Hugues Thomas and Chen Chen and Jian Zhang},
  journal= {arXiv preprint arXiv:2506.05689},
  year   = {2025}
}

备注

Main paper and appendix