中文

当你的表亲拥有正确连接:面向相关且数据不平衡语言的无人监督双语词典归纳

计算与语言 2024-03-26 v2

摘要

大多数现有的无人监督双语词典归纳(BLI)方法依赖于高质量的静态或上下文嵌入,需要两种语言的大量单语语料库。然而,无人监督 BLI 最有可能对低资源语言(LRLs)有用,而此类语言并无大型数据集可用。我们通常感兴趣的是针对相关的高资源语言(HRLs)为 LRLs 构建双语资源,从而导致 BLI 的极度不平衡数据设置。我们首先表明,文献中最先进的 BLI 方法对于严重数据不平衡的语言对表现出近乎零的性能,表明此类设置需要更鲁棒的技术。然后我们提出一种用于相关 LRL 与 HRL 之间无人监督 BLI 的新方法,其仅需要在 HRL 的掩码语言模型上进行推理,并证明了其在真正低资源语言博杰普尔语和马加希语(每种单语 token 少于 5M)相对于印地语的有效性。我们进一步在(中资源)马拉地语和尼泊尔语上呈现实验,以按资源范围比较方法性能,并发布我们针对五种低资源印度语言(博杰普尔语、马加希语、阿瓦迪语、布拉杰语和迈蒂利语)相对于印地语所得的词典。

关键词

引用

@article{arxiv.2305.14012,
  title  = {When your Cousin has the Right Connections: Unsupervised Bilingual Lexicon Induction for Related Data-Imbalanced Languages},
  author = {Niyati Bafna and Cristina España-Bonet and Josef van Genabith and Benoît Sagot and Rachel Bawden},
  journal= {arXiv preprint arXiv:2305.14012},
  year   = {2024}
}

备注

9 pages, Accepted at LREC-COLING 2024