对比蒸馏是一种样本高效的迁移学习自监督损失策略
计算与语言
2022-12-23 v1 机器学习
摘要
传统的强化学习方法侧重于直接从片段决策中学习决策策略,同时缓慢且隐式地学习泛化所需的组合表示语义。尽管已有方法采用辅助自监督损失在同时学习决策策略的过程中优化表示,但从手工设计且独立于上下文的自监督损失(多视图)中学习组合表示,对现实世界的适应仍然相对缓慢,因为现实世界包含许多非独立同分布子空间,要求在不同抽象层级上在时间和空间注意力模式上实现快速分布偏移。相比之下,监督式语言模型级联已展现出适应多种多样流形的灵活性,以及自主任务迁移所需的自学习潜力。然而迄今为止,语言模型的迁移方法(如少样本学习和微调)仍需要人类监督,而使用自学习方法的迁移学习尚未得到充分探索。我们提出了一种名为对比蒸馏的自监督损失策略,该策略显化了与源任务和目标任务均具有高互信息的潜变量,范围涵盖从权重到词元。我们展示了该方法如何超越常见的迁移学习方法,并指出了一个有用的设计维度,即在在线迁移中权衡计算量与泛化能力。对比蒸馏可通过从记忆中采样得到改进,并提出了一种简单算法,能比随机采样更高效地为对比损失采样负样本。
引用
@article{arxiv.2212.11353,
title = {Contrastive Distillation Is a Sample-Efficient Self-Supervised Loss Policy for Transfer Learning},
author = {Chris Lengerich and Gabriel Synnaeve and Amy Zhang and Hugh Leather and Kurt Shuster and François Charton and Charysse Redwood},
journal= {arXiv preprint arXiv:2212.11353},
year = {2022}
}