自编码器作为跨模态教师:预训练的 2D 图像 Transformer 能否助力 3D 表征学习?
计算机视觉与模式识别
2023-02-03 v2
摘要
深度学习的成功高度依赖于带全面标注的大规模数据,相较于 2D 图像或自然语言,3D 数据中此类数据的获取更为昂贵且耗时。这提升了利用以多于 3D 的数据预训练的模型作为教师进行跨模态知识迁移的潜力。本文中,我们以知识蒸馏的统一视角重审掩码建模,并展示以 2D 图像或自然语言预训练的基础 Transformer 可通过训练自编码器作为跨模态教师(ACT)来帮助自监督 3D 表征学习。预训练的 Transformer 经离散变分自编码自监督被迁移为跨模态 3D 教师,其间 Transformer 被冻结并采用提示微调以获得更好的知识继承。由 3D 教师编码的潜特征被用作掩码点建模的目标,其中暗知识被蒸馏至 3D Transformer 学生以作为基础几何理解。我们的 ACT 预训练 3D 学习器在各种下游基准上达到最先进的泛化能力,例如在 ScanObjectNN 上总体准确率 88.21%。代码已发布于 https://github.com/RunpeiDong/ACT。
引用
@article{arxiv.2212.08320,
title = {Autoencoders as Cross-Modal Teachers: Can Pretrained 2D Image Transformers Help 3D Representation Learning?},
author = {Runpei Dong and Zekun Qi and Linfeng Zhang and Junbo Zhang and Jianjian Sun and Zheng Ge and Li Yi and Kaisheng Ma},
journal= {arXiv preprint arXiv:2212.08320},
year = {2023}
}
备注
Accepted at ICLR 2023