重新思考基于语言模型的半监督学习
计算与语言
2023-05-23 v1 人工智能
机器学习
摘要
半监督学习(SSL)是一种广受关注的设定,旨在有效利用无标签数据提升下游自然语言处理(NLP)任务中的模型性能。当前,利用无标签数据有两类流行方法:自训练(ST)与任务自适应预训练(TAPT)。ST 使用教师模型为无标签数据赋予伪标签,而 TAPT 在微调前于无标签数据上继续预训练。据我们所知,TAPT 在 SSL 任务中的有效性尚未被系统研究,且此前无工作直接比较 TAPT 与 ST 在利用无标签数据池方面的能力。本文给出一项广泛的实证研究,比较五种最先进 ST 方法与 TAPT 在多种 NLP 任务及数据规模(含域内与域外设定)下的表现。令人惊讶的是,我们发现相较于更复杂的 ST 方法,TAPT 是一种更强健的 SSL 学习器,即便仅使用数百无标签样本或存在域偏移时亦然,且往往在 SSL 中带来比全监督设定更大的提升。我们进一步分析揭示了在标签或无标签数据规模较小或存在域偏移时使用 ST 方法的风险。我们为未来 SSL 研究提供新视角,建议采用无监督预训练目标而非依赖伪标签。
引用
@article{arxiv.2305.13002,
title = {Rethinking Semi-supervised Learning with Language Models},
author = {Zhengxiang Shi and Francesco Tonolini and Nikolaos Aletras and Emine Yilmaz and Gabriella Kazai and Yunlong Jiao},
journal= {arXiv preprint arXiv:2305.13002},
year = {2023}
}
备注
Findings of ACL 2023. Code is available at https://github.com/amzn/pretraining-or-self-training