中文

IndoLEM与IndoBERT:面向印尼语NLP的基准数据集与预训练语言模型

计算与语言 2020-11-03 v1

摘要

尽管印尼语由近2亿人使用且为全球第十大语言,它在NLP研究中代表性不足。既往印尼语工作受限于标注数据集匮乏、语言资源稀疏以及资源缺乏标准化。本工作中,我们发布包含印尼语七项任务的IndoLEM数据集,涵盖形态句法、语义与语篇。我们额外发布面向印尼语的新预训练语言模型IndoBERT,并在IndoLEM上评估它,同时对照已有资源进行基准测试。实验表明,IndoBERT在IndoLEM中大多数任务上取得最先进性能。

关键词

引用

@article{arxiv.2011.00677,
  title  = {IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP},
  author = {Fajri Koto and Afshin Rahimi and Jey Han Lau and Timothy Baldwin},
  journal= {arXiv preprint arXiv:2011.00677},
  year   = {2020}
}

备注

Accepted at COLING 2020 - The 28th International Conference on Computational Linguistics