中文

DETRDistill:面向 DETR 系列模型的通用知识蒸馏框架

计算机视觉与模式识别 2023-03-20 v4

摘要

基于 Transformer 的检测器(DETRs)因其简单框架而日益流行,但庞大的模型尺寸和沉重的时间消耗阻碍了其在实际世界中的部署。而知识蒸馏(KD)可能是一项有吸引力的技术,可将巨型检测器压缩为小型检测器,以获得可比的检测性能和低推理成本。由于 DETRs 将目标检测表述为集合预测问题,为经典基于卷积的检测器设计的现有 KD 方法可能不直接适用。在本文中,我们提出 DETRDistill,一种专用于 DETR 系列的新型知识蒸馏方法。具体而言,我们首先设计匈牙利匹配 logits 蒸馏以鼓励学生模型具有与教师 DETRs 完全相同的预测。接下来,我们提出目标感知特征蒸馏以帮助学生模型从教师模型以对象为中心的特征中学习。最后,为提高学生 DETR 的收敛速度,我们引入查询先验分配蒸馏以加速学生模型从训练良好的查询和教师模型的稳定分配中学习。在 COCO 数据集上的大量实验结果验证了我们的方法的有效性。值得注意的是,DETRDistill 始终将各种 DETRs 提升超过 2.0 mAP,甚至超越其教师模型。

关键词

引用

@article{arxiv.2211.10156,
  title  = {DETRDistill: A Universal Knowledge Distillation Framework for DETR-families},
  author = {Jiahao Chang and Shuo Wang and Haiming Xu and Zehui Chen and Chenhongyi Yang and Feng Zhao},
  journal= {arXiv preprint arXiv:2211.10156},
  year   = {2023}
}

备注

10 pages, 6 figures