当半监督学习遇上迁移学习:训练策略、模型与数据集
计算机视觉与模式识别
2018-12-14 v1
摘要
半监督学习(SSL)已被证明是一种同时利用有标签与无标签数据的有效方式。近期的半监督方法聚焦于深度神经网络,并在若干基准(CIFAR10、CIFAR100与SVHN)上取得了有前景的结果。然而,它们多数实验基于从头训练的模型而非预训练模型。另一方面,当目标域标注数据有限时,迁移学习已展现其价值。由此引出一个直观问题:在微调预训练模型时能否引入SSL?我们全面研究了从预训练模型出发的SSL方法在不同条件下的表现,包括训练策略、架构选择与数据集。通过本研究,我们获得了若干有趣且实用的观察。尽管实践者对这些观察已有直观理解,我们进行了全面的实证分析并表明:(1)相较于从头随机初始化训练,从预训练模型训练时SSL技术相对全监督基线的增益更小;(2)当用于训练预训练模型的源数据域与目标任务的域差异显著时,SSL带来的增益明显更高;(3)某些SSL方法能够推进全监督基线(如伪标签法)。我们希望本研究能深化对SSL的理解,并助力开发更有效的SSL方法以利用预训练模型。代码现已发布于github。
引用
@article{arxiv.1812.05313,
title = {When Semi-Supervised Learning Meets Transfer Learning: Training Strategies, Models and Datasets},
author = {Hong-Yu Zhou and Avital Oliver and Jianxin Wu and Yefeng Zheng},
journal= {arXiv preprint arXiv:1812.05313},
year = {2018}
}
备注
Technical report