中文

探索无编码器架构在3D大型多模态模型中的潜力

计算机视觉与模式识别 2025-12-09 v4 人工智能 计算与语言

摘要

无编码器架构在2D大型多模态模型(LMMs)中已有初步探索,但其是否能有效应用于3D理解场景仍是一个开放问题。本文提出了首个系统性地考察无编码器架构在3D LMMs 中潜力的研究,以缓解编码器基于3D LMMs 的长期挑战,这些挑战包括:在推理阶段无法适应不同点云分辨率,以及编码器提取的点特征不满足大型语言模型(LLM)的语义需求。我们确定了3D LMMs 删除预训练编码器并使LLM承担3D编码器角色的关键方面:1) 我们提出了LLM嵌入式语义编码策略,用于预训练阶段,探讨各种点云自监督损失的影响。我们提出了混合语义损失来提取高层语义。2) 我们引入了层次几何聚合策略,用于指令调优阶段。这将归纳偏置纳入LLM层,以关注点云的局部细节。最终,我们提出了首个无编码器3D LMM,ENEL。我们的7B模型与最先进的模型PointLLM-PiSA-13B相当,分别在分类、描述和VQA任务上达到57.91%、61.0%和55.20%。我们的实验结果表明,无编码器架构在3D理解领域取代编码器架构具有高度前景。代码已发布于 https://github.com/Ivan-Tang-3D/ENEL

关键词

引用

@article{arxiv.2502.09620,
  title  = {Exploring the Potential of Encoder-free Architectures in 3D LMMs},
  author = {Yiwen Tang and Zoey Guo and Zhuhao Wang and Ray Zhang and Qizhi Chen and Junli Liu and Delin Qu and Zhigang Wang and Dong Wang and Bin Zhao and Xuelong Li},
  journal= {arXiv preprint arXiv:2502.09620},
  year   = {2025}
}