中文

少即是多:面向高效 DETR 的聚焦注意力

计算机视觉与模式识别 2023-07-25 v1 人工智能

摘要

类 DETR 模型显著提升了检测器的性能,甚至超越了经典卷积模型。然而,传统编码器结构中对所有 token 不加区分地同等对待带来了冗余的计算负担。近期的稀疏化策略利用一部分信息丰富的 token,通过稀疏编码器在保持性能的同时降低注意力复杂度。但这些方法往往依赖于不可靠的模型统计。此外,简单地减少 token 数量在很大程度上阻碍了检测性能,限制了这些稀疏模型的应用。我们提出 Focus-DETR,将注意力聚焦于更具信息量的 token,以在计算效率与模型精度之间实现更好的权衡。具体而言,我们用双重注意力重构编码器,其中包含一种 token 评分机制,该机制综合考虑来自多尺度特征图的物体定位与类别语义信息。我们高效地舍弃背景查询,并基于评分增强细粒度物体查询的语义交互。在相同设置下与最先进的稀疏类 DETR 检测器相比,我们的 Focus-DETR 在复杂度相当的情况下于 COCO 上取得 50.4AP(+2.2)。代码见 https://github.com/huawei-noah/noah-research/tree/master/Focus-DETR 与 https://gitee.com/mindspore/models/tree/master/research/cv/Focus-DETR。

关键词

引用

@article{arxiv.2307.12612,
  title  = {Less is More: Focus Attention for Efficient DETR},
  author = {Dehua Zheng and Wenhui Dong and Hailin Hu and Xinghao Chen and Yunhe Wang},
  journal= {arXiv preprint arXiv:2307.12612},
  year   = {2023}
}

备注

8 pages, 6 figures, accepted to ICCV2023