中文

通过词汇扩展改进预训练多语言模型

计算与语言 2019-09-30 v1

摘要

近年来,预训练语言模型在广泛的自然语言处理任务中取得了显著成功。然而,在多语言环境下,为每种语言在大规模语料上预训练深度语言模型极其消耗资源。与其独立地穷尽式预训练单语语言模型,一种替代方案是在数百种语言的大规模语料上预训练一个强大的多语言深度语言模型。然而,此类模型中每种语言的词汇量相对较小,尤其是对于低资源语言。这一限制不可避免地阻碍了这些多语言模型在诸如序列标注等任务上的性能,其中深入的 token 级或句子级理解至关重要。在本文中,受先前为单语环境设计的方法启发,我们基于预训练多语言模型 BERT 研究了两种方法(即联合映射与混合映射),以解决包括词性标注、命名实体识别、机器翻译质量估计和机器阅读理解在内的多种任务上的未登录词(OOV)问题。实验结果表明,使用混合映射更具前景。据我们所知,这是首项尝试解决并讨论多语言环境下 OOV 问题的工作。

关键词

引用

@article{arxiv.1909.12440,
  title  = {Improving Pre-Trained Multilingual Models with Vocabulary Expansion},
  author = {Hai Wang and Dian Yu and Kai Sun and Janshu Chen and Dong Yu},
  journal= {arXiv preprint arXiv:1909.12440},
  year   = {2019}
}

备注

CONLL 2019 final version