用于目标检测的视觉Transformer
计算机视觉与模式识别
2022-06-14 v1
摘要
卷积神经网络(CNN)一直是许多计算机视觉应用的首选范式。然而卷积操作有一个显著弱点,即仅在像素的局部邻域内运算,因而遗漏了周围邻居的全局信息。另一方面,Transformer(更具体地说是自注意力网络)作为近期进展涌现以捕捉输入的长程交互,但它们主要应用于序列建模任务,如神经机器翻译、图像描述及其他自然语言处理任务。Transformer 已应用于自然语言相关任务并取得可喜结果。但其在视觉相关任务中的应用远未令人满意。考虑到卷积神经网络与 Transformer 各自的弱点,本文研究将自注意力用于判别性视觉任务——目标检测,作为卷积的替代方案。我们提出模型 DetTransNet。大量实验表明,在 COCO 上,我们的模型在许多不同模型与尺度(包括 ResNets)的目标检测中带来一致提升,同时保持参数量相近。特别地,我们的方法在 COCO 目标检测任务上相较其他基线模型取得了 1.2% 平均精度(Average Precision)的提升。
引用
@article{arxiv.2206.06323,
title = {Visual Transformer for Object Detection},
author = {Michael Yang},
journal= {arXiv preprint arXiv:2206.06323},
year = {2022}
}
备注
In preparation for short paper of conferences. I am using the name Michael Yang