PatchRot:一种用于训练视觉 Transformer 的自监督技术
计算机视觉与模式识别
2022-10-31 v1
摘要
视觉 Transformer 需要海量标注数据才能超越卷积神经网络。然而,标注大规模数据集是一个极其昂贵的过程。自监督学习技术通过以无监督方式学习与监督学习相似的特征,缓解了这一问题。在本文中,我们提出了一种为视觉 Transformer 量身定制的自监督技术 PatchRot。PatchRot 对图像和图像块进行旋转,并训练网络预测旋转角度。该网络学习从图像中提取全局和局部特征。我们在不同数据集上的大量实验表明,PatchRot 训练学习到的丰富特征优于监督学习和所比较的基线。
引用
@article{arxiv.2210.15722,
title = {PatchRot: A Self-Supervised Technique for Training Vision Transformers},
author = {Sachin Chhabra and Prabal Bijoy Dutta and Hemanth Venkateswara and Baoxin Li},
journal= {arXiv preprint arXiv:2210.15722},
year = {2022}
}
备注
NeurIPS Workshop on Vision Transformers: Theory and Applications (VTTA)