中文

PointDico:由扩散模型引导的对比式 3D 表示学习

计算机视觉与模式识别 2025-12-10 v1

摘要

自监督表示学习在自然语言处理和 2D 计算机视觉中取得了显著进展。然而现有方法在表示 3D 数据时面临难题,由于其无序且密度不均的特性。通过对主流对比式和生成式方法的深入分析,我们发现对比模型倾向于过拟合,而 3D 掩码自编码器在处理无序点云方面困难。由此我们受启发,尝试通过共享扩散和对比模型的优势来学习 3D 表示,这并非易事,因二者范式间存在模式差异。本文提出了 \textit{PointDico},一种无缝集成这些方法的新模型。\textit{PointDico} 通过知识蒸馏的方式,从去噪生成式建模和跨模态对比学习中学习,其中扩散模型作为对比模型的指导。我们引入了用于多尺度几何特征提取的分层金字塔条件生成器,并采用双通道设计有效整合局部和全局上下文信息。\textit{PointDico} 在 3D 表示学习方面实现了新的最佳性能,例如在 ScanObjectNN 上的 \textbf{94.32%} 准确率,ShapeNetPart 上的 \textbf{86.5%} Inst. mIoU。

关键词

引用

@article{arxiv.2512.08330,
  title  = {PointDico: Contrastive 3D Representation Learning Guided by Diffusion Models},
  author = {Pengbo Li and Yiding Sun and Haozhe Cheng},
  journal= {arXiv preprint arXiv:2512.08330},
  year   = {2025}
}

备注

Accepted by IJCNN 2025