ResT:一种用于视觉识别的高效 Transformer
计算机视觉与模式识别
2021-10-15 v5
摘要
本文提出了一种高效的多尺度视觉 Transformer,称为 ResT,它可作为图像识别的通用骨干网络。与现有采用标准 Transformer 模块以固定分辨率处理原始图像的方法不同,我们的 ResT 具有若干优势:(1)构建了内存高效的多头自注意力,通过简单的深度可分离卷积压缩内存,并在注意力头维度上投影交互,同时保持多头机制的多样性能力;(2)位置编码构建为空间注意力,更灵活,可处理任意尺寸的输入图像而无需插值或微调;(3)不同于在每个阶段开始时直接进行分词,我们将块嵌入设计为在二维重塑的令牌图上带步长的重叠卷积操作堆叠。我们在图像分类及下游任务上对 ResT 进行了全面验证。实验结果表明,所提出的 ResT 能以较大优势超越近期最先进的骨干网络,展示了 ResT 作为强大骨干的潜力。代码和模型将在 https://github.com/wofmanaf/ResT 公开。
引用
@article{arxiv.2105.13677,
title = {ResT: An Efficient Transformer for Visual Recognition},
author = {Qinglong Zhang and Yubin Yang},
journal= {arXiv preprint arXiv:2105.13677},
year = {2021}
}
备注
ResT is an efficient multi-scale vision Transformer that can tackle input images with arbitrary size. arXiv admin note: text overlap with arXiv:2103.14030 by other authors