Pts3D-LLM:探讨3D场景理解中标记结构的影响
计算机视觉与模式识别
2025-06-09 v1
摘要
有效地为多模态大语言模型(MLLMs)表示3D场景至关重要且具有挑战性。现有方法通常仅依赖2D图像特征并采用多种标记化方法。本工作对3D标记结构进行了严格的研究,系统比较了基于视频和基于点的表示方法,同时保持一致的模型骨干和参数。我们提出了一种新方法,通过融合来自Sonata预训练的Point Transformer V3编码器的3D点云特征来丰富视觉标记。我们的实验表明,融合显式3D特征显著提升了性能。进一步地,我们展示了当点被巧妙采样和排序后,基于点的标记结构可以与基于视频的标记结构不相上下。我们的方法的最佳模型在多个3D理解基准测试中均实现了最先进的成绩。我们强调将标记结构作为关键贡献,以及透明报告多个随机种子平均结果的实践,我们认为这对该领域的稳健进步至关重要。
引用
@article{arxiv.2506.05689,
title = {Pts3D-LLM: Studying the Impact of Token Structure for 3D Scene Understanding With Large Language Models},
author = {Hugues Thomas and Chen Chen and Jian Zhang},
journal= {arXiv preprint arXiv:2506.05689},
year = {2025}
}
备注
Main paper and appendix