中文

关于孟加拉语词类比评测的研究

计算与语言 2023-04-11 v1

摘要

本文提出了一个用于评测孟加拉语词嵌入质量的高质量数据集,这是自然语言处理(NLP)领域的一项基础任务。尽管孟加拉语是全球第七大通用语言,但它属于低资源语言,流行的NLP模型难以取得良好表现。构建可靠的孟加拉语词嵌入评测测试集对于基准比对和指导未来研究至关重要。我们提供了专门针对孟加拉语的Mikolov风格词类比评测集,样本量为16678,以及Mikolov数据集的翻译与整理版本,含10594个样本用于跨语言研究。我们使用不同最先进嵌入模型进行的实验表明,孟加拉语具有自身独特特征,当前孟加拉语嵌入在两类数据集上仍难以达到高准确率。我们建议未来研究应聚焦于使用更大数据集训练模型,并考虑孟加拉语独特的形态学特征。本研究是为孟加拉语构建可靠NLP系统的第一步。

关键词

引用

@article{arxiv.2304.04613,
  title  = {On Evaluation of Bangla Word Analogies},
  author = {Mousumi Akter and Souvika Sarkar and Shubhra Kanti Karmaker Santu},
  journal= {arXiv preprint arXiv:2304.04613},
  year   = {2023}
}