对信德语词嵌入在语义类比和下游任务中的评估
计算与语言
2024-08-29 v1
摘要
本文提出了由超过6100万词组成的新词嵌入语料库,来源于多个网络资源。我们设计了一个预处理管道,用于过滤爬取数据中的不需要的文本。随后,将清理后的词汇输入到最先进的连续词袋(CBOW)、skip-gram和GloVe词嵌入算法中。对于预训练嵌入的评估,我们使用流行的内在和外在评估方法。评估结果表明,连续词袋和skip-gram在两种内在和外在评估方法中均优于GloVe和现有的信德语fastText词嵌入。
引用
@article{arxiv.2408.15720,
title = {An Evaluation of Sindhi Word Embedding in Semantic Analogies and Downstream Tasks},
author = {Wazir Ali and Saifullah Tumrani and Jay Kumar and Tariq Rahim Soomro},
journal= {arXiv preprint arXiv:2408.15720},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:1911.12579