中文

AfriVEC:面向非洲语言的词嵌入模型——以丰语和诺比因语为例

计算与语言 2021-03-19 v2 人工智能

摘要

从Word2Vec到GloVe,词嵌入模型在当前自然语言处理的最优结果中发挥了关键作用。这些模型旨在为词与实体提供有意义且独特的向量化表示,已被证明能高效提取相似性并建立反映词与实体间语义与上下文关系的联系。非洲语言占全球口语语言的31%以上,近来成为大量研究的对象。然而,据我们所知,目前针对这些语言的词与实体的嵌入模型极少乃至没有,本文所研究语言亦无此类模型。在描述GloVe、Word2Vec和Poincaré嵌入的功能后,我们为丰语(Fon)和诺比因语(Nobiin)构建了Word2Vec与Poincaré词嵌入模型,结果显示出良好前景。我们测试了这些模型间迁移学习的适用性,以此作为非洲语言共同缓解资源稀缺的里程碑,并试图对结果给出语言学与社会学解释。我们的主要贡献在于唤起更多对构建专属于非洲语言、可用且能显著提升其自然语言处理下游任务性能的詞嵌入模型的关注。官方仓库与实现见 https://github.com/bonaventuredossou/afrivec

关键词

引用

@article{arxiv.2103.05132,
  title  = {AfriVEC: Word Embedding Models for African Languages. Case Study of Fon and Nobiin},
  author = {Bonaventure F. P. Dossou and Mohammed Sabry},
  journal= {arXiv preprint arXiv:2103.05132},
  year   = {2021}
}