并非所有图像都值得16x16词:用于高效图像识别的动态Transformer
计算机视觉与模式识别
2021-10-27 v2 人工智能
机器学习
摘要
视觉Transformer(ViT)已在大规模图像识别中取得显著成功。它们将每张二维图像分割为固定数量的图块,每个图块被视为一个token。通常,用更多token表示图像会带来更高的预测精度,但同时也会导致计算成本急剧增加。为在精度与速度间取得良好权衡,token数量经验性地设为16x16或14x14。本文中,我们认为每幅图像都有其自身特性,理想情况下token数量应取决于每个单独输入。事实上,我们观察到存在相当数量的“简单”图像,仅用4x4的token即可准确预测,而只有一小部分“困难”图像需要更精细的表示。受此现象启发,我们提出一种动态Transformer(Dynamic Transformer),为每个输入图像自动配置合适的token数量。这是通过级联多个token数量递增的Transformer实现的,在测试时以自适应方式顺序激活,即一旦产生足够置信的预测便终止推理。我们进一步设计了动态Transformer不同组件间的高效特征复用与关系复用机制,以减少冗余计算。在ImageNet、CIFAR-10和CIFAR-100上的大量实验结果表明,我们的方法在理论计算效率与实际推理速度方面均显著优于具有竞争力的基线。基于PyTorch和MindSpore的代码与预训练模型可在 https://github.com/blackfeather-wang/Dynamic-Vision-Transformer 和 https://github.com/blackfeather-wang/Dynamic-Vision-Transformer-MindSpore 获取。
引用
@article{arxiv.2105.15075,
title = {Not All Images are Worth 16x16 Words: Dynamic Transformers for Efficient Image Recognition},
author = {Yulin Wang and Rui Huang and Shiji Song and Zeyi Huang and Gao Huang},
journal= {arXiv preprint arXiv:2105.15075},
year = {2021}
}
备注
Accepted by NeurIPS 2021