评估低资源语言的语言模型微调技术
计算与语言
2019-07-04 v1
摘要
与主流语言(如英语和法语)不同,低资源语言常缺乏专家标注语料库与基准资源,导致难以直接应用最先进的技术。本文通过两种方式缓解低资源菲律宾语的此稀缺问题。首先,我们引入一个称为 WikiText-TL-39 的菲律宾语新基准语言建模数据集。其次,我们展示诸如 BERT 与 ULMFiT 的语言模型微调技术可用于在低资源设定下一致地训练鲁棒分类器,当使用私有情感数据集进行微调时,训练样本数从 10K 降至 1K 仅使验证误差至多增加 0.0782。
引用
@article{arxiv.1907.00409,
title = {Evaluating Language Model Finetuning Techniques for Low-resource Languages},
author = {Jan Christian Blaise Cruz and Charibeth Cheng},
journal= {arXiv preprint arXiv:1907.00409},
year = {2019}
}
备注
Pretrained models and datasets available at https://github.com/jcblaisecruz02/Tagalog-BERT