利用文本到图像扩散模型进行点云自监督学习
计算机视觉与模式识别
2025-07-15 v1
摘要
基于扩散的模型广泛用于文本到图像生成,已在 2D 表示学习中证明有效。最近,这一框架被扩展到 3D 自监督学习,通过构建条件点生成器来增强 3D 表示。然而,其性能受限于 3D 扩散模型的训练数据规模有限。我们假设,特别是以大规模数据集训练的文本到图像扩散模型(如Stable Diffusion, SD),其强大的能力可帮助克服这些限制。为检验这一假设,我们提出 PointSD 框架,利用 SD 模型进行 3D 自监督学习。通过替换 SD 模型的文本编码器为 3D 编码器,我们训练一个点到图像扩散模型,使点云引导渲染的噪声图像去噪。利用训练好的点到图像扩散模型,我们以无噪声图像为输入、点云为条件,从而提取 SD 特征。随后,我们通过对齐这些特征来训练 3D 主干网络,从而促进直接语义学习。全面实验和消融研究表明,SD 模型能够增强点云自监督学习。代码已公开于 https://github.com/wdttt/PointSD。
引用
@article{arxiv.2507.09102,
title = {Harnessing Text-to-Image Diffusion Models for Point Cloud Self-Supervised Learning},
author = {Yiyang Chen and Shanshan Zhao and Lunhao Duan and Changxing Ding and Dacheng Tao},
journal= {arXiv preprint arXiv:2507.09102},
year = {2025}
}
备注
Accepted by ICCV 2025