中文

评估低资源语言的语言模型微调技术

计算与语言 2019-07-04 v1

摘要

与主流语言(如英语和法语)不同,低资源语言常缺乏专家标注语料库与基准资源,导致难以直接应用最先进的技术。本文通过两种方式缓解低资源菲律宾语的此稀缺问题。首先,我们引入一个称为 WikiText-TL-39 的菲律宾语新基准语言建模数据集。其次,我们展示诸如 BERT 与 ULMFiT 的语言模型微调技术可用于在低资源设定下一致地训练鲁棒分类器,当使用私有情感数据集进行微调时,训练样本数从 10K 降至 1K 仅使验证误差至多增加 0.0782。

关键词

引用

@article{arxiv.1907.00409,
  title  = {Evaluating Language Model Finetuning Techniques for Low-resource Languages},
  author = {Jan Christian Blaise Cruz and Charibeth Cheng},
  journal= {arXiv preprint arXiv:1907.00409},
  year   = {2019}
}

备注

Pretrained models and datasets available at https://github.com/jcblaisecruz02/Tagalog-BERT