ExpPoint-MAE:面向自监督点云 Transformer 的更优可解释性与性能
计算机视觉与模式识别
2024-04-16 v3 机器学习
摘要
本文深入探究点云领域中通过自监督获得的 Transformer 的特性。具体而言,我们评估掩码自编码(Masked Autoencoding)作为预训练方案的有效性,并探索动量对比(Momentum Contrast)作为一种替代方案。在我们的研究中,我们考察数据量对所学特征的影响,并揭示 Transformer 跨域行为中的相似性。通过全面的视觉化,我们观察到 Transformer 学会关注语义上有意义的区域,表明预训练带来对底层几何更好的理解。此外,我们检视微调过程及其对所学表征的影响。基于此,我们设计了一种解冻策略,在不对模型或训练流程引入任何其他修改的情况下持续优于我们的基线,并在 Transformer 模型中于分类任务上取得最先进(state-of-the-art)结果。
引用
@article{arxiv.2306.10798,
title = {ExpPoint-MAE: Better interpretability and performance for self-supervised point cloud transformers},
author = {Ioannis Romanelis and Vlassis Fotis and Konstantinos Moustakas and Adrian Munteanu},
journal= {arXiv preprint arXiv:2306.10798},
year = {2024}
}