中文

PatchRot:一种用于训练视觉 Transformer 的自监督技术

计算机视觉与模式识别 2022-10-31 v1

摘要

视觉 Transformer 需要海量标注数据才能超越卷积神经网络。然而,标注大规模数据集是一个极其昂贵的过程。自监督学习技术通过以无监督方式学习与监督学习相似的特征,缓解了这一问题。在本文中,我们提出了一种为视觉 Transformer 量身定制的自监督技术 PatchRot。PatchRot 对图像和图像块进行旋转,并训练网络预测旋转角度。该网络学习从图像中提取全局和局部特征。我们在不同数据集上的大量实验表明,PatchRot 训练学习到的丰富特征优于监督学习和所比较的基线。

关键词

引用

@article{arxiv.2210.15722,
  title  = {PatchRot: A Self-Supervised Technique for Training Vision Transformers},
  author = {Sachin Chhabra and Prabal Bijoy Dutta and Hemanth Venkateswara and Baoxin Li},
  journal= {arXiv preprint arXiv:2210.15722},
  year   = {2022}
}

备注

NeurIPS Workshop on Vision Transformers: Theory and Applications (VTTA)