面向工业规模的自然语言理解半监督学习
计算与语言
2021-03-31 v1 人工智能
机器学习
摘要
本文提出一种基于师生框架的生产级半监督学习(SSL)流水线,其利用数百万未标注样本来改进自然语言理解(NLU)任务。我们研究生产 SSL 语境下与未标注数据使用相关的两个问题:1) 如何从海量未标注数据池中筛选有益于 SSL 训练的样本;2) 所选数据如何影响不同前沿 SSL 技术的性能。我们比较了四种广泛使用的 SSL 技术——伪标签(PL)、知识蒸馏(KD)、虚拟对抗训练(VAT)和交叉视图训练(CVT)——并结合两种数据选择方法,包括基于委员会的选择和基于子模优化的选择。我们进一步考察了这些技术在应用于意图分类(IC)和命名实体识别(NER)任务时的优缺点,并给出了指明何种情况下每种方法可能有益于改进大规模 NLU 系统的指导建议。
引用
@article{arxiv.2103.15871,
title = {Industry Scale Semi-Supervised Learning for Natural Language Understanding},
author = {Luoxin Chen and Francisco Garcia and Varun Kumar and He Xie and Jianhua Lu},
journal= {arXiv preprint arXiv:2103.15871},
year = {2021}
}
备注
NAACL 2021 Industry track