以重建促对比:由生成式预训练引导的对比式3D表示学习
计算机视觉与模式识别
2023-05-23 v2
摘要
主流的3D表示学习方法建立在对比式或生成式建模的预训练任务之上,这些方法在各种下游任务上的性能都取得了巨大提升。然而,我们发现这两种范式具有不同的特性:(i)对比模型是数据饥渴型的,存在表示过拟合问题;(ii)生成模型存在数据填充问题,与对比模型相比,其数据扩展能力较差。这促使我们通过共享两种范式的优点来学习3D表示,但由于两种范式之间的模式差异,这并非易事。在本文中,我们提出了将这两种范式统一起来的“以重建对比”(ReCon)方法。ReCon通过集成蒸馏进行训练,同时从生成式建模教师和单/跨模态对比教师中学习,其中生成式学生指导对比式学生。我们提出了一种编码器-解码器风格的ReCon-block,通过带有停止梯度的交叉注意力来传递知识,从而避免了预训练过拟合和模式差异问题。ReCon在3D表示学习中达到了新的最优水平,例如在ScanObjectNN上达到了91.26%的准确率。代码已发布于https://github.com/qizekun/ReCon。
引用
@article{arxiv.2302.02318,
title = {Contrast with Reconstruct: Contrastive 3D Representation Learning Guided by Generative Pretraining},
author = {Zekun Qi and Runpei Dong and Guofan Fan and Zheng Ge and Xiangyu Zhang and Kaisheng Ma and Li Yi},
journal= {arXiv preprint arXiv:2302.02318},
year = {2023}
}
备注
Accepted at ICML 2023