中文

用于 Transformer 检测的基于递归瞥见的解码器

计算机视觉与模式识别 2022-04-13 v2

摘要

尽管基于 Transformer 的检测器 (DETR) 越来越受欢迎,但其全局注意力建模需要极长的训练周期来优化并实现有前景的检测性能。与主要开发先进特征或嵌入设计以解决训练问题的现有研究不同,我们指出基于感兴趣区域 的检测细化可以轻松帮助缓解 DETR 方法的训练困难。基于此,我们在本文中引入了一种新颖的基于递归瞥见的解码器 (REcurrent Glimpse-based decOder, REGO)。具体而言,REGO 采用多阶段递归处理结构,以帮助 DETR 的注意力逐渐更准确地聚焦于前景目标。在每个处理阶段,从上一阶段检测结果中具有扩大边界框区域的 RoI 中提取视觉特征作为瞥见特征。然后,引入基于瞥见的解码器,基于瞥见特征和上一阶段的注意力建模输出来提供细化的检测结果。在实践中,REGO 可以轻松嵌入到具有代表性的 DETR 变体中,同时保持其完全端到端的训练和推理流程。具体而言,REGO 帮助 Deformable DETR 在 MSCOCO 数据集上仅用 36 个训练 epoch 即实现了 44.8 AP,而最初的 DETR 和 Deformable DETR 分别需要 500 和 50 个 epoch 才能达到可比的性能。实验还表明,在 50 个训练 epoch 的相同设置下,REGO 持续提升了不同 DETR 检测器的性能,相对增益高达 7%。代码可在 https://github.com/zhechen/Deformable-DETR-REGO 获取。

关键词

引用

@article{arxiv.2112.04632,
  title  = {Recurrent Glimpse-based Decoder for Detection with Transformer},
  author = {Zhe Chen and Jing Zhang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2112.04632},
  year   = {2022}
}