仅使用词嵌入的158种语言词义消歧
计算与语言
2020-03-17 v1
摘要
上下文中的词义消歧对人类来说很容易,但对自动方法而言却是一项重大挑战。人们开发了复杂的监督式和基于知识的方法来解决这个问题。然而,(i) 给定单词的监督训练实例固有的齐夫分布和/或 (ii) 语言知识表示的质量促使人们开发完全无监督和脱离知识的词义消歧(WSD)方法。它们对于没有任何资源来构建监督式和/或基于知识模型的资源匮乏语言尤其有用。在本文中,我们提出了一种方法,该方法以标准预训练词嵌入模型作为输入,并归纳出一个完整的词义词库,可用于上下文消歧。我们使用该方法基于 Grave 等人(2018)的原始预训练 fastText 词嵌入为158种语言归纳出一组词义词库,从而在这些语言中实现了 WSD。模型和系统均可在线获取。
引用
@article{arxiv.2003.06651,
title = {Word Sense Disambiguation for 158 Languages using Word Embeddings Only},
author = {Varvara Logacheva and Denis Teslenko and Artem Shelmanov and Steffen Remus and Dmitry Ustalov and Andrey Kutuzov and Ekaterina Artemova and Chris Biemann and Simone Paolo Ponzetto and Alexander Panchenko},
journal= {arXiv preprint arXiv:2003.06651},
year = {2020}
}
备注
10 pages, 5 figures, 4 tables, accepted at LREC 2020