中文

基于锚点与相关语言链的低资源语言多语词嵌入方法

计算与语言 2023-11-22 v1

摘要

仅有数百万 token 量级数据的极低资源语言,由于跨语言词表示质量较差,未能得到多语 NLP 方法的良好支持。近期研究表明,若源语言与低资源目标语言相关,则可取得良好的跨语言性能。然而,并非所有语言对都具有相关性。在本文中,我们提出通过一种新颖的基于语言链的方法构建多语词嵌入(MWEs),该方法引入中间相关语言以弥合远距离源语言与目标语言之间的鸿沟。我们每次构建一种语言的 MWEs,从资源丰富的源语言出发,依次添加语言链中的每种语言,直至到达目标语言。我们将一种半联合双语方法扩展至多语言,通过围绕多语空间锚定目标语言,消除了以往工作的主弱点,即独立训练的单调语嵌入。我们在 4 个语族的双语词典归纳上评估了我们的方法,涉及 4 种极低资源(<5M token)和 4 种中等低资源(<50M)目标语言,在两类上都显示出性能提升。此外,我们的分析揭示了中间语言高质量嵌入的重要性,以及利用多语空间中所有语言的锚点的重要性。

关键词

引用

@article{arxiv.2311.12489,
  title  = {Multilingual Word Embeddings for Low-Resource Languages using Anchors and a Chain of Related Languages},
  author = {Viktor Hangya and Silvia Severini and Radoslav Ralev and Alexander Fraser and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2311.12489},
  year   = {2023}
}

备注

Accepted at the MRL 2023 workshop