中文

通过词表裁剪实现高效的多语言语言模型压缩

计算与语言 2023-10-20 v3

摘要

多语言语言模型(LM)已成为NLP中尤其是非英语语言的强大工具。然而,由于覆盖不同语言词元的词表嵌入矩阵较大,多语言LM的模型参数仍然庞大。相反,单语LM仅可使用特定语言词表在目标语言中训练,但这需要大量预算和可靠语料库才能从头获得高质量LM。本文提出词表裁剪(VT),一种通过从词表中删除不相关词元将多语言LM词表缩减至目标语言的方法。理论上,VT可压缩任何现有多语言LM,以构建该多语言LM所覆盖任何语言的单语LM。在我们的实验中,我们表明VT能保留多语言LM的原始性能,同时规模小于原始多语言LM(通常约50%的原始词表大小即足够)。评估在四种广泛使用的多语言LM上以七种语言覆盖了四项NLP任务(两项生成任务和两项分类任务)。最后,我们表明该方法能通过保持小尺寸(如单语模型)且无需专门重训练,甚至限制潜在有害的社会偏见,兼顾单语与多语言之长。

关键词

引用

@article{arxiv.2305.15020,
  title  = {An Efficient Multilingual Language Model Compression through Vocabulary Trimming},
  author = {Asahi Ushio and Yi Zhou and Jose Camacho-Collados},
  journal= {arXiv preprint arXiv:2305.15020},
  year   = {2023}
}

备注

EMNLP 2023 findings