中文

用于书面语言识别的 WiLI 基准数据集

计算机视觉与模式识别 2018-01-25 v1 计算与语言

摘要

本文描述了用于单语书面自然语言识别的 WiLI-2018 基准数据集。WiLI-2018 是一个公开可用、免费的数据集,由来自 Wikipedia 的短文本摘录组成。它包含 235 种语言的各 1000 个段落,总计 23500 个段落。WiLI 是一个分类数据集:给定一段以单一主导语言写成的未知段落,必须判定它是哪种语言。

关键词

引用

@article{arxiv.1801.07779,
  title  = {The WiLI benchmark dataset for written language identification},
  author = {Martin Thoma},
  journal= {arXiv preprint arXiv:1801.07779},
  year   = {2018}
}

备注

{"pages": 12, "figures": 4, "language": "English", "author-ORCiD": ["https://orcid.org/0000-0002-6517-1690"]}