中文

面向大规模模型的原型引导跨任务知识蒸馏

计算机视觉与模式识别 2022-12-27 v1

摘要

近年来,大规模预训练模型在许多任务中展现出了优势。然而,由于巨大的计算复杂度和存储需求,将大规模模型应用于真实场景具有挑战性。一种常见的解决方案是知识蒸馏,其将大规模模型视为教师模型,并帮助训练小型学生模型以获得具有竞争力的性能。跨任务知识蒸馏拓展了大规模预训练模型的应用场景。现有的知识蒸馏工作侧重于直接模仿教师模型的最终预测或中间层,这些表示全局级特征且具有任务特异性。为缓解不同标签空间的约束,捕获不变的内在局部对象特征(如牛和马腿与尾巴的形状特征)起着关键作用。考虑到真实场景任务的复杂性与多变性,我们提出一种原型引导跨任务知识蒸馏(ProC-KD)方法,将大规模教师网络的内在局部级对象知识迁移到多种任务场景中。首先,为更好地在跨任务场景中迁移教师模型中的泛化知识,我们提出一个原型学习模块,从教师模型中对象本质特征表示进行学习。其次,针对多样化下游任务,我们提出任务自适应特征增强模块,利用学到的泛化原型特征增强学生模型的特征,并引导学生模型训练以提升其泛化能力。在多种视觉任务上的实验结果证明了我们的方法在大规模模型跨任务知识蒸馏场景中的有效性。

关键词

引用

@article{arxiv.2212.13180,
  title  = {Prototype-guided Cross-task Knowledge Distillation for Large-scale Models},
  author = {Deng Li and Aming Wu and Yahong Han and Qi Tian},
  journal= {arXiv preprint arXiv:2212.13180},
  year   = {2022}
}