利用部分标签信息的半监督对比学习
机器学习
2024-06-04 v2 机器学习
摘要
在半监督学习中,未标注样本的信息被用于改进从已标注样本学到的模型。在某些学习问题中,可从原本未标注的样本推断出部分标签信息,并用以进一步改进模型。特别地,当已知训练样本的子集具有相同标签(即便标签本身缺失)时,便存在部分标签信息。通过对比学习目标鼓励模型对所有此类样本赋予相同标签,我们有可能提升其性能。我们称这种鼓励为 Nullspace Tuning(零空间调谐),因为任意一对具有相同标签的样本之差向量应位于线性模型的零空间中。本文中,我们通过在特征明确的公开数据集上采用严谨的比较框架,考察了使用部分标签信息的益处。我们表明,部分标签所提供的额外信息使测试误差较优秀的半监督方法通常降低 2 倍,最佳情况下达 5.5 倍。我们还表明,将 Nullspace Tuning 加入较新的前沿方法 MixMatch 可将其测试误差降低至多 1.8 倍。
引用
@article{arxiv.2003.07921,
title = {Semi-supervised Contrastive Learning Using Partial Label Information},
author = {Colin B. Hansen and Vishwesh Nath and Diego A. Mesa and Yuankai Huo and Bennett A. Landman and Thomas A. Lasko},
journal= {arXiv preprint arXiv:2003.07921},
year = {2024}
}