中文

QKVA网格:图像视角下的注意力与堆叠DETR

计算机视觉与模式识别 2022-08-17 v2 人工智能

摘要

我们提出一种名为Stacked-DETR(SDETR)的新模型,其继承了标准DETR的主要思想。我们从两个方向改进DETR:简化训练成本,以及引入堆叠架构以提升性能。针对前者,我们关注Attention块内部并提出QKVA网格,一种描述注意力过程的新视角。借此,我们能进一步理解Attention如何作用于图像问题以及多头的效果。这两个思路促成了单头编码器层的设计。针对后者,SDETR相较DETR取得了更优性能(+0.6AP,+2.7APs)。尤其在小物体性能上,SDETR取得了优于优化后Faster R-CNN基线的结果,而这曾是DETR的短板。我们的改动基于DETR的代码。训练代码与预训练模型可在 https://github.com/shengwenyuan/sdetr 获取。

关键词

引用

@article{arxiv.2207.04313,
  title  = {QKVA grid: Attention in Image Perspective and Stacked DETR},
  author = {Wenyuan Sheng},
  journal= {arXiv preprint arXiv:2207.04313},
  year   = {2022}
}