ACAM-KD:用于知识蒸馏的自适应协同注意力掩码
计算机视觉与模式识别
2025-03-11 v1
摘要
密集视觉预测任务(如检测和分割)对于时间敏感型应用(例如自动驾驶和视频监控)至关重要。尽管深度模型取得了出色的性能,但其效率仍然是一个挑战。知识蒸馏(KD)是一种有效的模型压缩技术,但现有的基于特征的知识蒸馏方法依赖于静态的、由教师驱动的特征选择,无法适应学生模型不断演变的学习状态,也无法利用动态的师生交互。为了解决这些局限性,我们提出了用于知识蒸馏的自适应师生协同注意力掩码(ACAM-KD),该方法引入了两个关键组件:(1)师生交叉注意力特征融合(STCA-FF),自适应地整合来自两个模型的特征,以实现更具交互性的蒸馏过程;(2)自适应空间-通道掩码(ASCM),动态生成重要性掩码以增强空间和通道维度的特征选择。与传统的知识蒸馏方法不同,ACAM-KD 能够在整个蒸馏过程中适应学生模型不断演变的需求。在多个基准上的大量实验验证了其有效性。例如,在 COCO2017 上,当从 ResNet-101 教师模型向 ResNet-50 学生模型进行蒸馏时,ACAM-KD 的目标检测性能比现有最优方法提升了高达 1.4 mAP。对于 Cityscapes 上的语义分割任务,以 DeepLabV3-MobileNetV2 作为学生模型时,其 mIoU 相比基线提升了 3.09。
引用
@article{arxiv.2503.06307,
title = {ACAM-KD: Adaptive and Cooperative Attention Masking for Knowledge Distillation},
author = {Qizhen Lan and Qing Tian},
journal= {arXiv preprint arXiv:2503.06307},
year = {2025}
}
备注
8 pages, 10 tables, 3 figures