不同域间的直接蒸馏
机器学习
2024-01-17 v1 人工智能
计算机视觉与模式识别
摘要
知识蒸馏(KD)旨在利用大型预训练教师网络的知识来学习一个紧凑的学生网络,其中两个网络均基于来自相同分布的数据进行训练。然而,在实际应用中,学生网络可能需要在一个新场景(即目标域)中执行任务,该场景通常与教师网络的已知场景(即源域)存在显著差异。传统的域适应技术可以与KD通过两阶段过程相结合以弥合域差距,但由于计算消耗高以及两个阶段累积的额外误差,两阶段方法的最终可靠性往往受限。为解决此问题,我们提出了一种名为“不同域间的直接蒸馏”(4Ds)的新单阶段方法。我们首先设计了一个基于傅里叶变换的可学习适配器,以将域不变知识与域特定知识分离开。然后,我们构建了一个融合-激活机制,将宝贵的域不变知识迁移到学生网络,同时鼓励教师网络内的适配器学习目标数据的域特定知识。其结果是,教师网络能够有效地迁移与学生网络目标域对齐的类别知识。在各种基准数据集上的密集实验表明,我们提出的4Ds方法成功地生成了可靠的学生网络,并优于最先进的方法。
引用
@article{arxiv.2401.06826,
title = {Direct Distillation between Different Domains},
author = {Jialiang Tang and Shuo Chen and Gang Niu and Hongyuan Zhu and Joey Tianyi Zhou and Chen Gong and Masashi Sugiyama},
journal= {arXiv preprint arXiv:2401.06826},
year = {2024}
}