任务自适应预训练与自训练在自然语言理解中是互补的
计算与语言
2023-02-21 v2
摘要
任务自适应预训练 (TAPT) 和自训练 (ST) 已成为利用大量无标签数据改进自然语言理解 (NLU) 任务的主要半监督方法。然而,尚不清楚它们是否学习到相似的表示,或者它们能否被有效结合。在本文中,我们表明 TAPT 和 ST 可以通过简单的 TFS 协议(遵循 TAPT -> 微调 -> 自训练 (TFS) 流程)实现互补。实验结果表明,TFS 协议能够有效利用无标签数据,在涵盖情感分类、释义识别、自然语言推理、命名实体识别和对话槽分类的六个数据集上持续取得强劲的联合增益。我们研究了多种半监督设定,并一致表明通过遵循 TFS 流程,TAPT 和 ST 带来的增益可以强烈叠加。我们希望 TFS 能够作为未来 NLP 研究的一个重要半监督基线。
引用
@article{arxiv.2109.06466,
title = {Task-adaptive Pre-training and Self-training are Complementary for Natural Language Understanding},
author = {Shiyang Li and Semih Yavuz and Wenhu Chen and Xifeng Yan},
journal= {arXiv preprint arXiv:2109.06466},
year = {2023}
}
备注
Findings of EMNLP 2021