Transformer 中的 Transformer
计算机视觉与模式识别
2021-10-27 v3 人工智能
摘要
Transformer 是一种新的神经架构,它通过注意力机制将输入数据编码为强大的特征。基本上,视觉 Transformer 首先将输入图像划分为若干局部块,然后计算它们的表示及其关系。由于自然图像具有高复杂度和丰富的细节与颜色信息,块的划分粒度不足以挖掘不同尺度和位置中物体的特征。在本文中,我们指出这些局部块内部的注意力对于构建高性能视觉 Transformer 也至关重要,并探索了一种新架构,即 Transformer iN Transformer (TNT)。具体而言,我们将局部块(如 16×16)视为“视觉句子”,并进一步将其划分为更小的块(如 4×4)作为“视觉词”。每个词与该给定视觉句子中其他词的注意力将以可忽略的计算成本进行计算。词和句子的特征都将被聚合以增强表示能力。在多个基准上的实验证明了所提出的 TNT 架构的有效性,例如,我们在 ImageNet 上达到了 81.5% 的 top-1 准确率,比具有相似计算成本的当前最优视觉 Transformer 高出约 1.7%。PyTorch 代码可在 https://github.com/huawei-noah/CV-Backbones 获取,MindSpore 代码可在 https://gitee.com/mindspore/models/tree/master/research/cv/TNT 获取。
引用
@article{arxiv.2103.00112,
title = {Transformer in Transformer},
author = {Kai Han and An Xiao and Enhua Wu and Jianyuan Guo and Chunjing Xu and Yunhe Wang},
journal= {arXiv preprint arXiv:2103.00112},
year = {2021}
}
备注
Accepted by NeurIPS 2021