IndoLEM与IndoBERT:面向印尼语NLP的基准数据集与预训练语言模型
计算与语言
2020-11-03 v1
摘要
尽管印尼语由近2亿人使用且为全球第十大语言,它在NLP研究中代表性不足。既往印尼语工作受限于标注数据集匮乏、语言资源稀疏以及资源缺乏标准化。本工作中,我们发布包含印尼语七项任务的IndoLEM数据集,涵盖形态句法、语义与语篇。我们额外发布面向印尼语的新预训练语言模型IndoBERT,并在IndoLEM上评估它,同时对照已有资源进行基准测试。实验表明,IndoBERT在IndoLEM中大多数任务上取得最先进性能。
引用
@article{arxiv.2011.00677,
title = {IndoLEM and IndoBERT: A Benchmark Dataset and Pre-trained Language Model for Indonesian NLP},
author = {Fajri Koto and Afshin Rahimi and Jey Han Lau and Timothy Baldwin},
journal= {arXiv preprint arXiv:2011.00677},
year = {2020}
}
备注
Accepted at COLING 2020 - The 28th International Conference on Computational Linguistics