中文

有限数据,无限潜力:基于掩码自编码器的ViT增强研究

计算机视觉与模式识别 2023-12-29 v2 人工智能

摘要

Vision Transformers(ViTs,视觉Transformer)已在计算机视觉中无处不在。尽管取得成功,ViTs缺乏归纳偏置,这使得在有限数据下训练它们较为困难。为应对该挑战,先前研究建议用自监督学习(SSL)顺序训练ViTs再微调。然而,我们观察到当训练数据量有限时,联合优化ViTs的主任务与自监督辅助任务(SSAT)出奇有益。我们探索了可与主任务一并优化且适宜的SSL任务、这些任务的训练方案,以及它们最有效时的数据规模。我们的发现表明,SSAT是一项强大技术,使ViTs能利用自监督任务与主任务的独特特性,取得优于典型“SSL预训练后顺序微调”ViTs的性能。我们在10个数据集上的实验表明,SSAT在显著降低碳足迹的同时大幅提升了ViT性能。我们还在视频域的深度伪造检测中证实了SSAT的有效性,展现了其泛化能力。代码见 https://github.com/dominickrei/Limited-data-vits。

关键词

引用

@article{arxiv.2310.20704,
  title  = {Limited Data, Unlimited Potential: A Study on ViTs Augmented by Masked Autoencoders},
  author = {Srijan Das and Tanmay Jain and Dominick Reilly and Pranav Balaji and Soumyajit Karmakar and Shyam Marjit and Xiang Li and Abhijit Das and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:2310.20704},
  year   = {2023}
}

备注

Accepted to WACV 2024