低资源语言文本分类基线的建立
计算与语言
2020-05-06 v1
摘要
尽管基于Transformer的微调技术在涉及低资源、低数据环境的任务中已被证明有效,但由于缺乏适当建立的基线和基准数据集,使得比较针对低资源场景的不同方法变得困难。在本工作中,我们提供三项贡献。首先,我们发布两个此前未公开的数据集,作为低资源语言菲律宾语文本分类和低资源多标签文本分类的基准数据集。其次,我们预训练了更适用于菲律宾语场景的BERT和DistilBERT模型。第三,我们引入一种简单的退化测试,用于衡量模型在训练样本数量减少时对性能退化的抵抗能力。我们分析了所预训练模型的退化速度,并探讨了使用该方法来比较旨在低资源场景下运行的模型。我们向研究社区发布所有模型和数据集以供使用。
引用
@article{arxiv.2005.02068,
title = {Establishing Baselines for Text Classification in Low-Resource Languages},
author = {Jan Christian Blaise Cruz and Charibeth Cheng},
journal= {arXiv preprint arXiv:2005.02068},
year = {2020}
}
备注
We release all our models, finetuning code, and data at https://github.com/jcblaisecruz02/Filipino-Text-Benchmarks