中文

预训练表示的双调优

机器学习 2020-11-13 v1 计算机视觉与模式识别

摘要

深度学习领域的常见做法是从大规模数据集预训练深度神经网络,然后将预训练模型微调至特定下游任务。近来,利用标签判别知识与数据内在结构的监督式和无监督式预训练表征学习方法均取得显著进展。直观上,下游任务的判别知识与内在结构均有助于微调,然而现有微调方法主要利用前者而丢弃后者。一个问题随之产生:如何充分挖掘数据内在结构以提升微调?本文提出Bi-tuning,一种将监督与无监督预训练表征微调至下游任务的通用学习框架。Bi-tuning在预训练表征骨干上集成两个头,推广了普通微调:一个采用改进对比交叉熵损失的分类头,以实例对比方式更好利用标签信息;一个采用新设计的类别对比学习损失的投影头,以类别一致方式充分开发数据内在结构。综合实验证实,Bi-tuning在监督与无监督预训练模型的微调任务上均以大幅优势取得SOTA结果(如在低数据量CUB上准确率绝对提升10.7%)。

关键词

引用

@article{arxiv.2011.06182,
  title  = {Bi-tuning of Pre-trained Representations},
  author = {Jincheng Zhong and Ximei Wang and Zhi Kou and Jianmin Wang and Mingsheng Long},
  journal= {arXiv preprint arXiv:2011.06182},
  year   = {2020}
}