中文

以紧凑型 Transformer 摆脱大数据范式

计算机视觉与模式识别 2022-06-09 v4 机器学习

摘要

随着 Transformer 成为语言处理的标准并在计算机视觉中取得进展,其参数规模与训练数据量也相应增长。许多人开始认为,正因如此,Transformer 并不适用于小规模数据。这一趋势引发诸多担忧,例如:某些科学领域数据有限,以及资源受限者被排除在该领域研究之外。本文中,我们旨在通过引入紧凑型 Transformer(Compact Transformers)提出一种小样本学习方法。我们首次表明,在合适规模与卷积分词下,Transformer 可避免过拟合并在小数据集上优于最先进 CNN。我们的模型在模型规模上灵活,参数可少至 0.28M 而取得具竞争力结果。我们最佳模型在 CIFAR-10 上从零训练以仅 3.7M 参数达到 98% 准确率,相较先前基于 Transformer 的模型数据效率显著提升,参数量小于其他 Transformer 的 1/10,且为 ResNet50 规模的 15% 而取得相近性能。CCT 还优于许多现代基于 CNN 的方法,甚至部分近期基于 NAS 的方法。此外,我们在 Flowers-102 上取得 99.76% top-1 准确率的新 SOTA 结果,并在 ImageNet(以 ViT 29% 的参数取得 82.71% 准确率)及 NLP 任务上改进现有基线。我们简单紧凑的 Transformer 设计使其对计算资源有限和/或处理小数据集者更可行研究,同时扩展现有关于数据高效 Transformer 的研究工作。代码与预训练模型公开于 https://github.com/SHI-Labs/Compact-Transformers。

关键词

引用

@article{arxiv.2104.05704,
  title  = {Escaping the Big Data Paradigm with Compact Transformers},
  author = {Ali Hassani and Steven Walton and Nikhil Shah and Abulikemu Abuduweili and Jiachen Li and Humphrey Shi},
  journal= {arXiv preprint arXiv:2104.05704},
  year   = {2022}
}

备注

Added new results on Flowers-102, distillation