中文

为跨语言语言模型预训练分配大词汇容量

计算与语言 2021-09-16 v1

摘要

与单语模型相比,跨语言模型通常需要更具表达力的词汇来充分表示所有语言。我们发现,由于词汇容量有限,许多语言在近期跨语言语言模型中代表性不足。为此,我们提出一种名为 VoCap 的算法来确定每种语言所需的词汇容量。然而,显著增加词汇量会大幅降低预训练速度。为解决这些问题,我们提出基于 k-NN 的目标采样来加速昂贵的 softmax。我们的实验表明,用 VoCap 学到的多语词汇有益于跨语言语言模型预训练。此外,基于 k-NN 的目标采样在取得可比性能与更快预训练速度的同时,缓解了增加词汇量的副作用。代码与预训练多语词汇可在 https://github.com/bozheng-hit/VoCapXLM 获取。

关键词

引用

@article{arxiv.2109.07306,
  title  = {Allocating Large Vocabulary Capacity for Cross-lingual Language Model Pre-training},
  author = {Bo Zheng and Li Dong and Shaohan Huang and Saksham Singhal and Wanxiang Che and Ting Liu and Xia Song and Furu Wei},
  journal= {arXiv preprint arXiv:2109.07306},
  year   = {2021}
}

备注

EMNLP 2021