中文

TransKD:用于高效语义分割的Transformer知识蒸馏

计算机视觉与模式识别 2024-09-06 v4 机器人学 图像与视频处理

摘要

自动驾驶领域的语义分割基准由大型预训练 transformers 主导,但其广泛应用受限于巨大的计算成本和漫长的训练时间。为突破该限制,我们从全面知识蒸馏的角度看待高效语义分割,旨在弥合多源知识提取与 transformer 特有的块嵌入之间的差距。我们提出基于 Transformer 的知识蒸馏(TransKD)框架,通过蒸馏大型教师 transformers 的特征图与块嵌入来学习紧凑的学生 transformers,从而跳过漫长的预训练过程并将 FLOPs 降低 >85.0%。具体而言,我们提出两个基本模块分别实现特征图蒸馏与块嵌入蒸馏:(1)交叉选择性融合(CSF)通过通道注意力与分层 transformers 内的特征图蒸馏实现跨阶段特征间的知识迁移;(2)块嵌入对齐(PEA)在分块过程中执行维度变换以促进块嵌入蒸馏。此外,我们引入两个优化模块从不同角度增强块嵌入蒸馏:(1)全局-局部上下文混合器(GL-Mixer)提取代表性嵌入的全局与局部信息;(2)嵌入助手(EA)作为一种嵌入方法,以教师通道数无缝桥接教师与学生模型。在 Cityscapes、ACDC、NYUv2 和 Pascal VOC2012 数据集上的实验表明,TransKD 优于最先进的蒸馏框架,并与耗时的预训练方法相媲美。源代码公开于 https://github.com/RuipingL/TransKD。

关键词

引用

@article{arxiv.2202.13393,
  title  = {TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation},
  author = {Ruiping Liu and Kailun Yang and Alina Roitberg and Jiaming Zhang and Kunyu Peng and Huayao Liu and Yaonan Wang and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2202.13393},
  year   = {2024}
}

备注

Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS). The source code is publicly available at https://github.com/RuipingL/TransKD