DMT:基于多个自监督教师的综合蒸馏
计算机视觉与模式识别
2023-12-20 v1
摘要
许多自监督学习范式,如对比学习和掩码图像建模,已被提出用于从无标签数据中获取强大且通用的表示。然而,这些模型通常仅在其特定框架内进行预训练,未能考虑视觉表示的互补性。为解决这一问题,我们引入了基于多个自监督教师的综合蒸馏(DMT)用于预训练模型压缩,该方法利用了多个现成自监督模型的优势。我们在著名基准数据集上的实验结果表明,所提方法在保持良好效率指标的同时,显著超越了最先进的竞争方法。在分类任务上,我们的利用三个不同自监督 ViT-Base 教师的 DMT 框架提升了小/微型模型及基座模型本身的性能。对于密集任务,DMT 将标准 SSL 模型在 MS-COCO 和 ADE20K 数据集上的 AP/mIoU 提升了 4.0%。
引用
@article{arxiv.2312.11938,
title = {DMT: Comprehensive Distillation with Multiple Self-supervised Teachers},
author = {Yuang Liu and Jing Wang and Qiang Zhou and Fan Wang and Jun Wang and Wei Zhang},
journal= {arXiv preprint arXiv:2312.11938},
year = {2023}
}
备注
ICASSP 2024