中文

MULTEXT-East

计算与语言 2020-04-01 v1

摘要

MULTEXT-East 语言资源是一个用于语言工程研究的多语言数据集,侧重于语言描述的形态句法层面。MULTEXT-East 数据集包括基于 EAGLES 的形态句法规范、形态句法词典和一个标注的多语言语料库。其平行语料库是 George Orwell 的小说《1984》,进行了句子对齐,并包含手工验证的形态句法描述和词元。这些资源统一使用 XML 编码,遵循文本编码倡议指南(TEI P5),涵盖 16 种语言:保加利亚语、克罗地亚语、捷克语、英语、爱沙尼亚语、匈牙利语、马其顿语、波斯语、波兰语、Resian 语、罗马尼亚语、俄语、塞尔维亚语、斯洛伐克语、斯洛文尼亚语和乌克兰语。该数据集有详细的文档记录,并可免费用于研究目的。本案例研究给出了 MULTEXT-East 资源开发的历史,介绍了其编码和组件,讨论了相关工作并得出了一些结论。

关键词

引用

@article{arxiv.2003.14026,
  title  = {MULTEXT-East},
  author = {Tomaž Erjavec},
  journal= {arXiv preprint arXiv:2003.14026},
  year   = {2020}
}