中文

面向精确知识迁移的目标感知表示解耦方法

机器学习 2022-02-28 v2 人工智能

摘要

在训练样本数量有限的情况下,对大规模数据集上预训练的深度神经网络进行微调是最实用的迁移学习范式之一。为了获得更好的泛化能力,以起点作为参考(SPAR),无论是通过权重还是特征,都已成功作为正则化器应用于迁移学习中。然而,由于源任务与目标任务之间存在领域差异,以直接方式保留知识显然存在负迁移的风险。本文提出一种新颖的迁移学习算法,引入目标感知表示解耦(TRED)的思想,将相对于目标任务的相关知识从原始源模型中解耦出来,并在微调目标模型时用作正则化器。具体而言,我们设计了两种替代方法,即最大化最大均值差异(Max-MMD)和最小化互信息(Min-MI),用于表示解耦。在多个真实世界数据集上的实验表明,我们的方法平均稳定地将标准微调提升超过 2%。TRED 还优于相关的先进迁移学习正则化器,如 L2-SP、AT、DELTA 和 BSS。

关键词

引用

@article{arxiv.2010.08532,
  title  = {Towards Accurate Knowledge Transfer via Target-awareness Representation Disentanglement},
  author = {Xingjian Li and Di Hu and Xuhong Li and Haoyi Xiong and Zhi Ye and Zhipeng Wang and Chengzhong Xu and Dejing Dou},
  journal= {arXiv preprint arXiv:2010.08532},
  year   = {2022}
}