基于ULMFit与回译的低资源文本分类
计算与语言
2019-03-27 v2 机器学习
摘要
在计算机视觉中,几乎所有最先进的深度学习系统都通过数据增强进行训练。然而在文本分类中,数据增强较少被实践,因为它必须在训练前执行且存在引入标签噪声的风险。我们用两类技术生成的数据扩充IMDB影评数据集:Wei和Zou [2019]提出的随机词元扰动,以及回译——翻译为另一种语言再译回英语。在低资源环境下,回译在先进ULMFit模型基础上带来显著提升。一个在wikitext103上预训练、仅用50个IMDB样本和500个回译生成的合成样本微调的ULMFit模型达到了80.6%准确率,相较无增强基线提升8.1%,且仅增加9分钟训练时间。随机词元扰动未带来任何提升却产生等同计算开销。用回译样本训练的好处随可用训练数据规模增大而减弱。在完整数据集上,两种增强技术均未超越ULMFit的先进性能。我们通过将回译用作测试时增强的一种形式,并将ULMFit与其他模型集成,取得了微小提升。
引用
@article{arxiv.1903.09244,
title = {Low Resource Text Classification with ULMFit and Backtranslation},
author = {Sam Shleifer},
journal= {arXiv preprint arXiv:1903.09244},
year = {2019}
}