Sparse DETR:具有可学习稀疏性的高效端到端目标检测
计算机视觉与模式识别
2022-03-07 v2 机器学习
摘要
DETR是首个使用transformer编码器-解码器架构的端到端目标检测器,展现出有竞争力的性能,但在高分辨率特征图上计算效率低下。后续工作Deformable DETR通过用可变形注意力替换稠密注意力提升了DETR的效率,实现了10倍更快的收敛和性能改进。Deformable DETR利用多尺度特征改善性能,然而编码器token数量相比DETR增加了20倍,且编码器注意力的计算成本仍是瓶颈。在我们的初步实验中,我们观察到即使只更新部分编码器token,检测性能也几乎不退化。受此启发,我们提出Sparse DETR,其选择性地仅更新预期被解码器引用的token,从而帮助模型有效检测物体。此外,我们展示在编码器中选中的token上施加辅助检测损失可在最小化计算开销的同时提升性能。我们验证了Sparse DETR在COCO数据集上即使仅用10%编码器token也取得优于Deformable DETR的性能。尽管仅对编码器token进行稀疏化,总计算成本相比Deformable DETR降低了38%,每秒帧数(FPS)提升了42%。代码见 https://github.com/kakaobrain/sparse-detr
引用
@article{arxiv.2111.14330,
title = {Sparse DETR: Efficient End-to-End Object Detection with Learnable Sparsity},
author = {Byungseok Roh and JaeWoong Shin and Wuhyun Shin and Saehoon Kim},
journal= {arXiv preprint arXiv:2111.14330},
year = {2022}
}
备注
ICLR 2022. Code is available at https://github.com/kakaobrain/sparse-detr