Sequencer:用于图像分类的深度LSTM
计算机视觉与模式识别
2023-01-13 v4 人工智能
机器学习
摘要
在最近的计算机视觉研究中,Vision Transformer(ViT)的出现迅速革新了各种架构设计工作:ViT利用自然语言处理中的自注意力实现了最先进的图像分类性能,而MLP-Mixer利用简单的多层感知机实现了有竞争力的性能。相比之下,若干研究也指出,精心重新设计的卷积神经网络(CNN)无需借助这些新思路即可实现与ViT相当的先进性能。在此背景下,何种归纳偏置适用于计算机视觉正引起越来越多的关注。在此我们提出Sequencer,一种新颖且具竞争力的ViT替代架构,为这些问题提供了新视角。与ViT不同,Sequencer使用LSTM而非自注意力层来建模长程依赖。我们还提出了Sequencer模块的二维版本,其中LSTM被分解为垂直和水平LSTM以提升性能。尽管简单,若干实验表明Sequencer表现极为出色:参数量为54M的Sequencer2D-L在仅使用ImageNet-1K的情况下实现了84.6%的top-1准确率。不仅如此,我们展示了它具有良好的可迁移性以及在双倍分辨率带上的鲁棒分辨率适应性。
引用
@article{arxiv.2205.01972,
title = {Sequencer: Deep LSTM for Image Classification},
author = {Yuki Tatsunami and Masato Taki},
journal= {arXiv preprint arXiv:2205.01972},
year = {2023}
}
备注
Accepted in NeurIPS 2022; camera ready edition