通过随机片段与自回归编码实现自监督:RandSAC
计算机视觉与模式识别
2022-10-27 v2 人工智能
摘要
受自然语言中自监督自回归表示学习(GPT 及其变体)的成功,以及近期基于 Vision Transformers (ViTs) 的视觉架构设计进展的启发,本文探讨了将此类训练策略应用于视觉特征学习时各种设计选择的影响。具体而言,我们引入了一种称为随机片段与自回归编码(RandSAC)的新策略。在 RandSAC 中,我们将图像块表示(图像令牌)分组为按层次排列的片段;在每个片段内,令牌并行预测,类似于 BERT,而跨片段预测是顺序的,类似于 GPT。我们说明片段的随机序列化显著提升了性能,并产生了在空间上长程(跨片段)与短程(片段内)预测上的分布,这对特征学习十分有效。我们阐明了这些设计选择的适用性,并在多个数据集(如 CIFAR10、CIFAR100、ImageNet)上探索了替代方案。尽管我们的预训练策略可与朴素 Transformer 配合使用,我们还提出了一种概念上简单但极为有效的 decoder 补充设计,允许可学习的跳跃连接至 encoder 的特征层,进一步提升了性能。
引用
@article{arxiv.2203.12054,
title = {Self-supervision through Random Segments with Autoregressive Coding (RandSAC)},
author = {Tianyu Hua and Yonglong Tian and Sucheng Ren and Michalis Raptis and Hang Zhao and Leonid Sigal},
journal= {arXiv preprint arXiv:2203.12054},
year = {2022}
}