CLoCKDistill:面向 DETR 的一致性位置与上下文感知知识蒸馏
计算机视觉与模式识别
2025-02-18 v1
摘要
随着 Detection Transformers (DETRs) 的提出,目标检测取得了显著进展。然而,这些模型计算需求大,给在资源受限环境(如自动驾驶汽车)中的部署带来了挑战。知识蒸馏是一种有效的压缩方法,广泛应用于 CNN 检测器,但其在 DETR 模型上的应用仍然有限。大多数针对 DETR 的 KD 方法未能蒸馏 Transformer 特有的全局上下文。此外,它们盲目相信教师模型,这有时会产生误导。为了弥补这些不足,本文提出了用于 DETR 检测器的一致性位置与上下文感知知识蒸馏,包含特征蒸馏和 logit 蒸馏两部分。对于特征蒸馏,与现有 KD 方法蒸馏骨干特征不同,我们蒸馏包含宝贵全局上下文和长程依赖的 Transformer 编码器输出(即 memory)。此外,我们在特征蒸馏期间用目标位置细节丰富该 memory,使学生模型能够在有效捕获全局上下文的同时优先关注相关区域。为了促进 logit 蒸馏,我们基于真实标签创建目标感知查询,使学生和教师解码器都能关注编码器 memory 中一致且准确的部分。在 KITTI 和 COCO 数据集上的实验表明,我们的 CLoCKDistill 方法在各种 DETR 上均有效,例如单尺度 DAB-DETR、多尺度 Deformable DETR 以及基于去噪的 DINO。我们的方法将学生检测器的性能提升了 2.2% 至 6.4%。
引用
@article{arxiv.2502.10683,
title = {CLoCKDistill: Consistent Location-and-Context-aware Knowledge Distillation for DETRs},
author = {Qizhen Lan and Qing Tian},
journal= {arXiv preprint arXiv:2502.10683},
year = {2025}
}
备注
8 pages