迈向基于Transformer的目标检测
计算机视觉与模式识别
2020-12-21 v1 人工智能
机器学习
摘要
Transformer已成为自然语言处理中的主导模型,这归功于其在海量数据上预训练、然后通过微调迁移到更小更特定任务的能力。Vision Transformer是首个将纯transformer模型直接应用于图像作为输入的主要尝试,表明与卷积网络相比,基于transformer的架构在基准分类任务上能取得有竞争力的结果。然而,注意力算子的计算复杂度意味着我们受限于低分辨率输入。对于检测或分割等更复杂的任务,保持高输入分辨率对于确保模型能在输出中正确识别和反映细节至关重要。这自然引出了一个问题:基于transformer的架构(如Vision Transformer)是否能够执行除分类以外的任务。在本文中,我们确定Vision Transformers可作为常用检测任务头部的骨干网络,以产生有竞争力的COCO结果。我们提出的模型ViT-FRCNN展现了若干与transformer相关的已知特性,包括大预训练容量和快速微调性能。我们还研究了相对于标准检测骨干的改进,包括对分布外图像的更优性能、对大物体的更好性能,以及减少对非极大值抑制的依赖。我们将ViT-FRCNN视为迈向复杂视觉任务(如目标检测)纯transformer解决方案的重要垫脚石。
引用
@article{arxiv.2012.09958,
title = {Toward Transformer-Based Object Detection},
author = {Josh Beal and Eric Kim and Eric Tzeng and Dong Huk Park and Andrew Zhai and Dmitry Kislyuk},
journal= {arXiv preprint arXiv:2012.09958},
year = {2020}
}