中文

IndoNLU:用于评估印尼语自然语言理解的基准与资源

计算与语言 2020-10-09 v3

摘要

尽管印尼语被认为是互联网上第四常用的语言,但由于缺乏可用资源,该语言在自然语言处理(NLP)方面的研究进展缓慢。为此,我们引入了首个用于印尼语自然语言理解(IndoNLU)任务训练、评估和基准测试的大规模资源。IndoNLU包含十二项任务,从单句分类到具有不同复杂程度的句对序列标注。这些任务的数据集位于不同领域和风格,以确保任务多样性。我们还提供了一组从大型且干净的印尼语数据集Indo4B训练得到的印尼语预训练模型(IndoBERT),该数据集收集自社交媒体文本、博客、新闻和网站等公开可用来源。我们为所有十二项任务发布基线模型,以及基准评估框架,从而使任何人都能对其系统性能进行基准测试。

关键词

引用

@article{arxiv.2009.05387,
  title  = {IndoNLU: Benchmark and Resources for Evaluating Indonesian Natural Language Understanding},
  author = {Bryan Wilie and Karissa Vincentio and Genta Indra Winata and Samuel Cahyawijaya and Xiaohong Li and Zhi Yuan Lim and Sidik Soleman and Rahmad Mahendra and Pascale Fung and Syafri Bahar and Ayu Purwarianti},
  journal= {arXiv preprint arXiv:2009.05387},
  year   = {2020}
}

备注

This paper will be presented in AACL-IJCNLP 2020 (with new results and acknowledgment)