中文

面向自监督视觉Transformer的自正则化对抗视图学习

计算机视觉与模式识别 2022-10-18 v1

摘要

自动数据增强(AutoAugment)策略在视觉Transformer的监督数据高效训练方案中不可或缺,并已在监督学习中取得最先进结果。尽管成功,其在自监督视觉Transformer上的发展与运用受多重阻碍:搜索成本高、缺乏监督、搜索空间不合适。本工作中,我们提出AutoView——一种自正则化对抗式AutoAugment方法,通过克服上述障碍为自监督视觉Transformer学习视图。首先,我们通过在单步前向-反向中同时学习视图与网络参数,分别最小化与最大化不同增强视图间的互信息,将AutoView的搜索成本降至近乎零。继而,为避免标签监督缺失导致的信息崩塌,我们提出自正则化损失项以保证信息传播。此外,通过修改通常面向监督学习设计的搜索空间,我们给出了用于自监督学习的精筛增强策略搜索空间。在ImageNet上,我们的AutoView相较RandAug基线取得显著改进(+10.2% k-NN准确率),并持续以明显优势超越最先进手动调优视图策略(最高+1.3% k-NN准确率)。大量实验表明,AutoView预训练亦有益于下游任务(ADE20K语义分割+1.2% mAcc,重访Oxford图像检索基准+2.8% mAP)并提升模型鲁棒性(ImageNet-A +2.3% Top-1 Acc,ImageNet-O +1.0% AUPR)。代码与模型将发布于https://github.com/Trent-tangtao/AutoView。

关键词

引用

@article{arxiv.2210.08458,
  title  = {Learning Self-Regularized Adversarial Views for Self-Supervised Vision Transformers},
  author = {Tao Tang and Changlin Li and Guangrun Wang and Kaicheng Yu and Xiaojun Chang and Xiaodan Liang},
  journal= {arXiv preprint arXiv:2210.08458},
  year   = {2022}
}