中文

基于词嵌入的低资源语言信德语新语料库

计算与语言 2021-01-01 v3

摘要

将词与短语表示为编码语义和句法属性的实数稠密向量,是自然语言处理(NLP)的重要组成。神经网络(NN)模型在 NLP 中的成功很大程度上依赖于在大型无标注语料上学习到的此类稠密词表示。信德语是一种形态丰富的语言,在巴基斯坦和印度有众多使用者,但缺乏可作为生成词嵌入和开发语言无关 NLP 系统测试平台的语料库。本文为低资源信德语开发了一个含逾 6100 万词的大型语料库,用于训练神经词嵌入。该语料使用 web-scrappy 从多个网络资源获取。由于信德语缺乏开源预处理工具,如此大型语料的预处理成为难题,特别是清洗从网络资源提取的噪声数据。因此,我们采用预处理流水线来过滤噪声文本。之后,利用清洗后的词表,以最先进的 GloVe、Skip-Gram(SG)和 Continuous Bag of Words(CBoW)word2vec 算法训练信德语词嵌入。采用余弦相似度矩阵和 WordSim-353 的内在评价方法来评估生成的信德语词嵌入。此外,我们将提出的词嵌入与近期发布的信德语 fastText(SdfastText)词表示进行比较。我们的内在评价结果表明,相较于 SdfastText 词表示,使用 SG、CBoW 和 GloVe 生成的信德语词嵌入质量更高。

关键词

引用

@article{arxiv.1911.12579,
  title  = {Word Embedding based New Corpus for Low-resourced Language: Sindhi},
  author = {Wazir Ali and Jay Kumar and Junyu Lu and Zenglin Xu},
  journal= {arXiv preprint arXiv:1911.12579},
  year   = {2021}
}

备注

Body 21 pages, Tables 9, Figures 7