中文

一种可扩展、高效且有效的基于 Transformer 的目标检测器

计算机视觉与模式识别 2022-04-19 v1 人工智能 机器学习

摘要

Transformers 已被广泛用于众多视觉问题,尤其是视觉识别与检测。Detection transformers 是首个用于目标检测的全端到端学习系统,而 vision transformers 是首个完全基于 Transformer 的图像分类架构。本文中,我们整合 Vision and Detection Transformers (ViDT) 以构建一种高效且有效的目标检测器。ViDT 引入重新配置的注意力模块,将最近的 Swin Transformer 扩展为独立的目标检测器,随后采用计算高效的 Transformer 解码器,利用多尺度特征与辅助技术,在不显著增加计算负载的情况下提升检测性能。此外,我们将其扩展为 ViDT+ 以支持目标检测与实例分割的联合任务学习。具体而言,我们附加了一个高效的多尺度特征融合层,并使用了两种更多的辅助训练损失:IoU-aware loss 与 token labeling loss。在 Microsoft COCO 基准数据集上的大量评估结果表明,ViDT 在现有全基于 Transformer 的目标检测器中取得了最佳的 AP 与延迟权衡,其扩展版 ViDT+ 凭借对大型模型的高可扩展性实现了 53.2 AP。源代码与训练模型可在 https://github.com/naver-ai/vidt 获取。

关键词

引用

@article{arxiv.2204.07962,
  title  = {An Extendable, Efficient and Effective Transformer-based Object Detector},
  author = {Hwanjun Song and Deqing Sun and Sanghyuk Chun and Varun Jampani and Dongyoon Han and Byeongho Heo and Wonjae Kim and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2204.07962},
  year   = {2022}
}

备注

An extension of the ICLR paper, ViDT: An Efficient and Effective Fully Transformer-based Object Detector. arXiv admin note: substantial text overlap with arXiv:2110.03921