中文

在构建无监督双语词嵌入之前不要忽视廉价的训练信号

计算与语言 2022-06-01 v1

摘要

双语词嵌入(BWE)是 NLP 模型跨语言迁移的基石之一。它们可以仅使用单语语料库而无监督地构建,这导致了大量聚焦于无监督 BWE 的工作。然而,当前大多数构建无监督 BWE 的方法并未将其结果与基于易获取跨语言信号的方法进行比较。本文认为,在开发无监督 BWE 方法时,应始终考虑此类信号。我们发现最有效的两种方法是:1)使用相同词作为种子词典(无监督方法错误地假设对于正字法不同的语言对这类词典不可用);2)将此类词典与通过以编辑距离阈值匹配单词罗马化版本所提取的词对相结合。我们在十三种非拉丁语言(及英语)上进行了实验,表明此类廉价信号表现良好,并且在如中文、日语、卡纳达语、泰米尔语和泰语等远距离语言对上优于更复杂的无监督方法。此外,它们甚至可与有监督方法中使用高质量词典相媲美。我们的结果表明,即使在远距离语言中,构建 BWE 时也不应忽视这些训练信号。

关键词

引用

@article{arxiv.2205.15713,
  title  = {Don't Forget Cheap Training Signals Before Building Unsupervised Bilingual Word Embeddings},
  author = {Silvia Severini and Viktor Hangya and Masoud Jalili Sabet and Alexander Fraser and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2205.15713},
  year   = {2022}
}

备注

BUCC@LREC 2022