你只需看一个序列:从纯序列到序列视角通过目标检测重新思考视觉中的 Transformer
计算机视觉与模式识别
2021-10-28 v3 人工智能
机器学习
摘要
Transformer 能否以极少的二维空间结构知识,从纯序列到序列的视角执行二维目标级与区域级识别?为回答这一问题,我们提出 You Only Look at One Sequence (YOLOS),一系列基于原生 Vision Transformer、对目标任务的修改、区域先验以及归纳偏置尽可能最少的目标检测模型。我们发现,仅在中等规模的 ImageNet-1k 数据集上预训练的 YOLOS 就已经能在具有挑战性的 COCO 目标检测基准上取得相当有竞争力的性能,例如直接从 BERT-Base 架构采用的 YOLOS-Base 在 COCO val 上可获得 42.0 box AP。我们还通过 YOLOS 讨论了当前预训练方案以及视觉中 Transformer 的模型缩放策略的影响与局限。代码与预训练模型可在 https://github.com/hustvl/YOLOS 获取。
引用
@article{arxiv.2106.00666,
title = {You Only Look at One Sequence: Rethinking Transformer in Vision through Object Detection},
author = {Yuxin Fang and Bencheng Liao and Xinggang Wang and Jiemin Fang and Jiyang Qi and Rui Wu and Jianwei Niu and Wenyu Liu},
journal= {arXiv preprint arXiv:2106.00666},
year = {2021}
}
备注
NeurIPS 2021 Camera Ready