重构点云序列:基于因果下一词预测的学习框架
计算机视觉与模式识别
2026-05-19 v1
摘要
随着多模态基础模型和预测预训练的快速进展,一个重要的开放问题是如何为 3D 点云构建更贴合下一词和下一嵌入学习的预训练范式。现有的点云自监督方法主要基于掩码重建或显式几何生成,仍局限于输入恢复而非预测依赖建模。本文引入 PointNTP,将点云预训练重新表述为完全因果、无解码器的潜在下一词预测问题。具体做法是将每个点云首先划分为局部补丁,并根据补丁中心几何序列化为结构化的 3D 令牌序列。随后该序列由无因果 Transformer 在前缀唯一条件下建模,并以移位预测目标训练,借助停止梯度目标实现稳定。这一设计使模型能够直接在潜在空间学习结构依赖,无需重建解码器或显式几何恢复。大量实验表明,所提 PointNTP 在多个下游任务上均表现优异:在 ScanObjectNN 的 OBJ_BG、OBJ_ONLY 和 PB_T50_RS 上分别取得 93.8%(+0.5%)、92.6%(+0.3%)和 89.3%(+1.1%);在 ShapeNetPart 上在 Cls.mIoU 上取得 85.0%(+0.1%);在 S3DIS Area 5 上达到 71.1% mAcc。解码器自由的因果潜在预测提供了一种简单、可扩展且可能跨模态的点云自监督学习范式,为 3D 数据的基础式预测学习提供了新的视角。
引用
@article{arxiv.2605.17566,
title = {Rethinking Point Clouds as Sequences: A Causal Next-Token Predictive Learning Framework},
author = {Yumeng Yao and Jingzhi Dong and Haowen Gu and Tao Chen and Zonghan Wu and Xiaoshui Huang and Yazhou Yao},
journal= {arXiv preprint arXiv:2605.17566},
year = {2026}
}
备注
10 pages, 2 figures. Code will be released upon acceptance