多语言文化无关词类比数据集
计算与语言
2022-06-01 v2
摘要
在文本处理中,深度神经网络大多将词嵌入用作输入。嵌入必须确保词之间的关系通过高维数值空间中的距离反映出来。为比较不同文本嵌入的质量,通常使用基准数据集。我们提出一个用于九种语言词类比任务的此类数据集集合:克罗地亚语、英语、爱沙尼亚语、芬兰语、拉脱维亚语、立陶宛语、俄语、斯洛文尼亚语和瑞典语。我们重新设计了原始单语类比任务,使其更具文化无关性,并为所涉语言构建了跨语言类比数据集。我们给出所创建数据集的基本统计及其使用 fastText 嵌入的初步评估。
引用
@article{arxiv.1911.10038,
title = {Multilingual Culture-Independent Word Analogy Datasets},
author = {Matej Ulčar and Kristiina Vaik and Jessica Lindström and Milda Dailidėnaitė and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:1911.10038},
year = {2022}
}
备注
7 pages, LREC2020 conference