中文

Sparse DETR:具有可学习稀疏性的高效端到端目标检测

计算机视觉与模式识别 2022-03-07 v2 机器学习

摘要

DETR是首个使用transformer编码器-解码器架构的端到端目标检测器,展现出有竞争力的性能,但在高分辨率特征图上计算效率低下。后续工作Deformable DETR通过用可变形注意力替换稠密注意力提升了DETR的效率,实现了10倍更快的收敛和性能改进。Deformable DETR利用多尺度特征改善性能,然而编码器token数量相比DETR增加了20倍,且编码器注意力的计算成本仍是瓶颈。在我们的初步实验中,我们观察到即使只更新部分编码器token,检测性能也几乎不退化。受此启发,我们提出Sparse DETR,其选择性地仅更新预期被解码器引用的token,从而帮助模型有效检测物体。此外,我们展示在编码器中选中的token上施加辅助检测损失可在最小化计算开销的同时提升性能。我们验证了Sparse DETR在COCO数据集上即使仅用10%编码器token也取得优于Deformable DETR的性能。尽管仅对编码器token进行稀疏化,总计算成本相比Deformable DETR降低了38%,每秒帧数(FPS)提升了42%。代码见 https://github.com/kakaobrain/sparse-detr

关键词

引用

@article{arxiv.2111.14330,
  title  = {Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity},
  author = {Byungseok Roh and JaeWoong Shin and Wuhyun Shin and Saehoon Kim},
  journal= {arXiv preprint arXiv:2111.14330},
  year   = {2022}
}

备注

ICLR 2022. Code is available at https://github.com/kakaobrain/sparse-detr