中文

多语言文化无关词类比数据集

计算与语言 2022-06-01 v2

摘要

在文本处理中,深度神经网络大多将词嵌入用作输入。嵌入必须确保词之间的关系通过高维数值空间中的距离反映出来。为比较不同文本嵌入的质量,通常使用基准数据集。我们提出一个用于九种语言词类比任务的此类数据集集合:克罗地亚语、英语、爱沙尼亚语、芬兰语、拉脱维亚语、立陶宛语、俄语、斯洛文尼亚语和瑞典语。我们重新设计了原始单语类比任务,使其更具文化无关性,并为所涉语言构建了跨语言类比数据集。我们给出所创建数据集的基本统计及其使用 fastText 嵌入的初步评估。

关键词

引用

@article{arxiv.1911.10038,
  title  = {Multilingual Culture-Independent Word Analogy Datasets},
  author = {Matej Ulčar and Kristiina Vaik and Jessica Lindström and Milda Dailidėnaitė and Marko Robnik-Šikonja},
  journal= {arXiv preprint arXiv:1911.10038},
  year   = {2022}
}

备注

7 pages, LREC2020 conference