中文

PointAlign:面向3D视觉语言模型的特征级对齐正则化

计算机视觉与模式识别 2026-03-03 v1

摘要

3D视觉语言模型(VLM)的发展对于机器人、自动驾驶和增强现实等应用至关重要,但受限于成熟的3D文本配对数据的稀缺。现有方法仅依赖于下一个token预测损失,仅使用语言token进行监督,导致对有限3D数据的效率利用不足,并在中间表示中造成显著的几何信息损失。为解决这些限制,我们提出了一种名为PointAlign的特征级对齐正则化方法。PointAlign通过一致性损失显式监督中间点云token在语言建模过程中保持精细的3D几何语义信息。具体而言,我们约束中间点云token在LLM中与视觉输入token对齐。通过仅训练轻量级对齐投影器和LoRA适配器,PointAlign实现了最小计算开销下的显式特征级监督,有效防止了几何退化。在ModelNet40和Objaverse数据集上的大量实验表明,我们的方法在分类任务上平均提高了2.08个百分点,在具有挑战性的开放词汇Objaverse分类任务上实现了显著的7.50个百分点的提升,以及在Qwen2-72B-Instruct评估的3D对象描述中实现了4.88个百分点的改进,验证了PointAlign的有效性。代码已公开于https://github.com/yharoldsu0627/PointAlign。

关键词

引用

@article{arxiv.2603.00412,
  title  = {PointAlign: Feature-Level Alignment Regularization for 3D Vision-Language Models},
  author = {Yuanhao Su and Shaofeng Zhang and Xiaosong Jia and Qi Fan},
  journal= {arXiv preprint arXiv:2603.00412},
  year   = {2026}
}

备注

CVPR 2026 Accepted