多尺度视觉Longformer:一种用于高分辨率图像编码的新视觉Transformer
计算机视觉与模式识别
2021-05-28 v2 人工智能
机器学习
摘要
本文提出一种新的视觉Transformer(ViT)架构——多尺度视觉Longformer,其通过两项技术显著增强了\cite{dosovitskiy2020image}中的ViT以编码高分辨率图像。其一是多尺度模型结构,以可控计算代价提供多尺度图像编码。其二是视觉Longformer的注意力机制,它是Longformer \cite{beltagy2020longformer}(最初为自然语言处理开发)的变体,相对于输入token数量实现了线性复杂度。全面的实证研究表明,在包括图像分类、目标检测和分割在内的一系列视觉任务上,新ViT显著优于若干强基线,包括现有ViT模型及其ResNet对应模型,以及同期工作\cite{wang2021pyramid}中的金字塔视觉Transformer。模型和源代码发布于\url{https://github.com/microsoft/vision-longformer}。
引用
@article{arxiv.2103.15358,
title = {Multi-Scale Vision Longformer: A New Vision Transformer for High-Resolution Image Encoding},
author = {Pengchuan Zhang and Xiyang Dai and Jianwei Yang and Bin Xiao and Lu Yuan and Lei Zhang and Jianfeng Gao},
journal= {arXiv preprint arXiv:2103.15358},
year = {2021}
}