面向密集预测任务的视觉Transformer自监督预训练
计算机视觉与模式识别
2022-06-08 v2
摘要
我们提出了一种用于密集预测任务的视觉Transformer自监督预训练新方法。该方法基于跨视图的对比损失,将像素级表示与全局图像表示进行比较。与仅基于全局图像表示的对比预训练相比,该策略能产生更适合密集预测任务的局部特征。此外,由于对比损失所需的负样本数量级为局部特征的数量,我们的方法不会受批大小减小的影响。我们在两个密集预测任务上验证了预训练策略的有效性:语义分割和单目深度估计。
引用
@article{arxiv.2205.15173,
title = {Self-Supervised Pre-training of Vision Transformers for Dense Prediction Tasks},
author = {Jaonary Rabarisoa and Valentin Belissen and Florian Chabot and Quoc-Cuong Pham},
journal= {arXiv preprint arXiv:2205.15173},
year = {2022}
}