聚合金字塔视觉 Transformer:用于无卷积图像识别的分割-变换-合并策略
计算机视觉与模式识别
2022-03-03 v1
摘要
随着 Transformer 在自然语言处理领域取得的成就,Transformer 中的编码器-解码器和注意力机制已被应用于计算机视觉。最近,在计算机视觉的多个任务(图像分类、目标检测、语义分割等)中,最先进的卷积神经网络已经引入了一些 Transformer 的概念。这证明了 Transformer 在图像识别领域具有良好的前景。在 Vision Transformer 被提出后,越来越多的工作开始使用自注意力完全替代卷积层。本工作基于 Vision Transformer,结合金字塔架构,使用分割-变换-合并策略提出组编码器,并将该网络架构命名为聚合金字塔视觉 Transformer (APVT)。我们在 CIFAR-10 数据集上执行图像分类任务,在 COCO 2017 数据集上执行目标检测任务。与其他使用 Transformer 作为骨干的网络架构相比,APVT 在降低计算成本的同时取得了优异的结果。我们希望这种改进策略能为未来计算机视觉领域的 Transformer 研究提供参考。
引用
@article{arxiv.2203.00960,
title = {Aggregated Pyramid Vision Transformer: Split-transform-merge Strategy for Image Recognition without Convolutions},
author = {Rui-Yang Ju and Ting-Yu Lin and Jen-Shiun Chiang and Jia-Hao Jian and Yu-Shian Lin and Liu-Rui-Yi Huang},
journal= {arXiv preprint arXiv:2203.00960},
year = {2022}
}
备注
6 pages, 5 figures