LSTM 与 BERT 在小语料上的比较
计算与语言
2020-09-14 v1 机器学习
摘要
NLP 领域近期的进展表明,迁移学习通过调优预训练模型而非从零开始,有助于为新任务取得最先进的结果。Transformer 在为许多 NLP 任务(包括但不限于文本分类、文本生成和序列标注)创造新的最先进结果方面取得了显著改进。这些成功案例大多基于大型数据集。在本文中,我们关注学术界和工业界科学家经常面临的一个现实场景:给定一个小数据集,我们能否使用像 BERT 这样的大型预训练模型并获得比简单模型更好的结果?为回答该问题,我们使用为构建聊天机器人收集的小规模意图分类数据集,并比较简单的双向 LSTM 模型与预训练 BERT 模型的性能。我们的实验结果表明,对于小数据集,双向 LSTM 模型可以取得比 BERT 模型显著更高的结果,且这些简单模型的训练时间远少于调优预训练对应模型。我们得出结论,模型的性能依赖于任务和数据,因此在做出模型选择之前,应考量这些因素,而非直接选择最流行的模型。
引用
@article{arxiv.2009.05451,
title = {A Comparison of LSTM and BERT for Small Corpus},
author = {Aysu Ezen-Can},
journal= {arXiv preprint arXiv:2009.05451},
year = {2020}
}