中文

对信德语词嵌入在语义类比和下游任务中的评估

计算与语言 2024-08-29 v1

摘要

本文提出了由超过6100万词组成的新词嵌入语料库,来源于多个网络资源。我们设计了一个预处理管道,用于过滤爬取数据中的不需要的文本。随后,将清理后的词汇输入到最先进的连续词袋(CBOW)、skip-gram和GloVe词嵌入算法中。对于预训练嵌入的评估,我们使用流行的内在和外在评估方法。评估结果表明,连续词袋和skip-gram在两种内在和外在评估方法中均优于GloVe和现有的信德语fastText词嵌入。

关键词

引用

@article{arxiv.2408.15720,
  title  = {An Evaluation of Sindhi Word Embedding in Semantic Analogies and Downstream Tasks},
  author = {Wazir Ali and Saifullah Tumrani and Jay Kumar and Tariq Rahim Soomro},
  journal= {arXiv preprint arXiv:2408.15720},
  year   = {2024}
}

备注

arXiv admin note: substantial text overlap with arXiv:1911.12579