基于卷积神经网络进行文本分类迁移学习的实践指南
计算与语言
2018-01-22 v1
摘要
当给定数据集的标注样本不足以训练准确模型时,迁移学习(TL)起着关键作用。在此类场景中,在源数据集上预训练模型所积累的知识可迁移至目标数据集,从而提升目标模型。尽管TL在基于图像的应用领域已被证实成功,其在自然语言处理(NLP)应用中的影响与实际使用仍是研究课题。由于其分层架构,深度神经网络(DNN)在调整参数和层深度方面提供了灵活性与可定制性,从而构成了利用TL的合适领域。本文中,我们报告了使用卷积神经网络(CNN)进行广泛实证实验所得的结果与结论,并试图揭示确保成功正迁移的经验法则。此外,我们也强调了可能导致负迁移的错误方式。我们探究了各层的可迁移性,并描述了超参数变化对迁移性能的影响。同时,我们给出了与最先进方法的准确率和模型大小比较。最后,我们从实证结果中推导推论,并提供实现成功正迁移的最佳实践。
引用
@article{arxiv.1801.06480,
title = {A Practitioners' Guide to Transfer Learning for Text Classification using Convolutional Neural Networks},
author = {Tushar Semwal and Gaurav Mathur and Promod Yenigalla and Shivashankar B. Nair},
journal= {arXiv preprint arXiv:1801.06480},
year = {2018}
}
备注
9 pages, 2 figures, accepted in SDM 2018