中文

Setswana语与Sepedi语的跨语言词嵌入训练

计算与语言 2022-03-01 v1 应用统计

摘要

非洲语言在自然语言处理技术的进展上仍然滞后,原因之一在于缺乏代表性数据,拥有一种能在语言间迁移信息的技术有助于缓解数据匮乏问题。本文训练了Setswana语和Sepedi语的单语词向量,并使用VecMap为Setswana-Sepedi创建跨语言嵌入以进行跨语言迁移。词嵌入是将词表示为连续浮点数的词向量,语义相似的词被映射到n维空间中的邻近点。词嵌入的思想基于分布假说,即语义相似的词分布于相似的上下文中(Harris, 1954)。跨语言嵌入通过为两个分别训练的单语向量学习共享向量空间来利用单语嵌入,使得含义相似的词由相似的向量表示。本文中,我们研究Setswana-Sepedi单语词向量的跨语言嵌入。我们使用VecMap中的无监督跨语言嵌入来训练Setswana-Sepedi跨语言词嵌入。我们使用语义评估任务评估Setswana-Sepedi跨语言词表示的质量。对于语义相似度任务,我们将WordSim和SimLex任务翻译为Setswana语和Sepedi语。我们作为本工作的一部分向其他研究者发布了该数据集。我们评估了嵌入的内在质量,以确定词嵌入的语义表示是否有改进。

关键词

引用

@article{arxiv.2111.06230,
  title  = {Training Cross-Lingual embeddings for Setswana and Sepedi},
  author = {Mack Makgatho and Vukosi Marivate and Tshephisho Sefara and Valencia Wagner},
  journal= {arXiv preprint arXiv:2111.06230},
  year   = {2022}
}

备注

Accepted (to appear) for the 2nd Workshop on Resources for African Indigenous Languages