中文

面向密集预测任务的视觉Transformer自监督预训练

计算机视觉与模式识别 2022-06-08 v2

摘要

我们提出了一种用于密集预测任务的视觉Transformer自监督预训练新方法。该方法基于跨视图的对比损失,将像素级表示与全局图像表示进行比较。与仅基于全局图像表示的对比预训练相比,该策略能产生更适合密集预测任务的局部特征。此外,由于对比损失所需的负样本数量级为局部特征的数量,我们的方法不会受批大小减小的影响。我们在两个密集预测任务上验证了预训练策略的有效性:语义分割和单目深度估计。

关键词

引用

@article{arxiv.2205.15173,
  title  = {Self-Supervised Pre-training of Vision Transformers for Dense Prediction Tasks},
  author = {Jaonary Rabarisoa and Valentin Belissen and Florian Chabot and Quoc-Cuong Pham},
  journal= {arXiv preprint arXiv:2205.15173},
  year   = {2022}
}