基于 Fasttext 嵌入的共现方法在乌尔都语词语相似度任务中的应用
计算与语言
2021-02-23 v1
摘要
乌尔都语是南亚广泛使用的一种语言。尽管乌尔都语存在大量文献,但数据仍不足以让 NLP 技术自然地处理该语言。对于高资源语言英语,存在非常高效的语言模型,但乌尔都语和其他低资源语言长期被忽视。为这些语言创建高效的语言模型,我们必须拥有良好的词嵌入模型。对于乌尔都语,我们只能找到使用 skip-gram 模型训练和开发的词嵌入。在本文中,我们通过从各种来源抓取和整合数据构建了乌尔都语语料库,并编制了乌尔都语词汇表。我们还修改了 fasttext 嵌入和 N-Grams 模型以使其能在我们构建的语料库上训练。我们将这些训练得到的嵌入用于词语相似度任务,并与现有技术进行比较。
引用
@article{arxiv.2102.10957,
title = {Co-occurrences using Fasttext embeddings for word similarity tasks in Urdu},
author = {Usama Khalid and Aizaz Hussain and Muhammad Umair Arshad and Waseem Shahzad and Mirza Omer Beg},
journal= {arXiv preprint arXiv:2102.10957},
year = {2021}
}