中文

使用Transformer的端到端目标检测

计算机视觉与模式识别 2020-05-29 v3

摘要

我们提出一种新方法,将目标检测视为直接的集合预测问题。我们的方法简化了检测流程,有效消除了对许多手工设计组件(如显式编码我们对任务先验知识的非极大值抑制过程或锚框生成)的需求。这一称为DEtection TRansformer(DETR)的新框架的主要组成部分是一个基于集合的全局损失(通过二分匹配强制唯一预测)和一个transformer编码器-解码器架构。给定一组固定的少量已学习目标查询,DETR推理对象之间的关系和全局图像上下文,以并行方式直接输出最终的预测集合。新模型在概念上简单,且不像许多其他现代检测器那样需要专用库。在具有挑战性的COCO目标检测数据集上,DETR展现出与成熟且高度优化的Faster RCNN基线相当的准确率和运行时间性能。此外,DETR可轻松以统一方式推广以产生全景分割。我们表明其显著优于竞争性基线。训练代码和预训练模型可在 https://github.com/facebookresearch/detr 获取。

关键词

引用

@article{arxiv.2005.12872,
  title  = {End-to-End Object Detection with Transformers},
  author = {Nicolas Carion and Francisco Massa and Gabriel Synnaeve and Nicolas Usunier and Alexander Kirillov and Sergey Zagoruyko},
  journal= {arXiv preprint arXiv:2005.12872},
  year   = {2020}
}