对比学习表征的通用性与标签效率之间的权衡
机器学习
2023-03-02 v1
摘要
预训练表征(亦称基础模型)近来已成为一种流行的学习范式:先利用大规模无标签数据预训练一个表征,再使用该表征之上、基于下游任务少量标签数据学习简单的预测器。表征有两个关键诉求:标签效率(能用少量标签数据在表征上学习出准确分类器的能力)与通用性(在广泛下游任务中的有用性)。本文关注该范式最流行的实现之一:带线性探测的对比学习,即在经对比学习预训练的表征上学习一个线性预测器。我们证明这两个诉求之间存在权衡,因而可能无法同时实现二者。具体而言,我们利用一个理论数据模型进行分析并表明:尽管更多样的预训练数据为不同任务带来更多样特征(提升通用性),却降低了对任务特定特征的重视,导致下游监督任务的样本复杂度更大,从而预测性能更差。受该分析指导,我们提出一种对比正则化方法来改善这一权衡。我们利用真实世界数据集与基础模型通过系统性实验,对分析和所提方法进行了实证验证。
引用
@article{arxiv.2303.00106,
title = {The Trade-off between Universality and Label Efficiency of Representations from Contrastive Learning},
author = {Zhenmei Shi and Jiefeng Chen and Kunyang Li and Jayaram Raghuram and Xi Wu and Yingyu Liang and Somesh Jha},
journal= {arXiv preprint arXiv:2303.00106},
year = {2023}
}
备注
42 pages