多语言神经语言模型在低资源领域的正则化优势
计算与语言
2019-06-05 v1 机器学习
机器学习
摘要
神经语言建模(LM)已在包括自动语音识别在内的若干应用中带来显著改进。然而,它们通常需要大量训练数据,而许多领域和语言并不具备这样的数据。在本研究中,我们提出一种多语言神经语言模型架构,在多种低资源语言的领域特定数据上联合训练。所提出的多语言LM在编码器和解码器中包含语言特定的词嵌入,以及一个语言特定的LSTM层,外加两个跨语言共享参数的LSTM层。该多语言LM模型促进了跨语言的迁移学习,在极低资源场景下充当额外的正则化器。我们将所提出的多语言方法与最先进的重度正则化神经LM相结合,并在四种语言的对话数据域上针对一系列训练数据规模进行了评估。与单语LM相比,结果表明当可用训练数据有限时,我们提出的多语言LM有显著改进,显示了极低资源语言建模中跨语言参数共享的优势。
引用
@article{arxiv.1906.01496,
title = {Regularization Advantages of Multilingual Neural Language Models for Low Resource Domains},
author = {Navid Rekabsaz and Nikolaos Pappas and James Henderson and Banriskhem K. Khonglah and Srikanth Madikeri},
journal= {arXiv preprint arXiv:1906.01496},
year = {2019}
}