热启动与干净爬取语料库——优质语言模型的秘诀
计算与语言
2022-01-19 v2
摘要
我们为冰岛语训练了多个语言模型,包括 IceBERT,其在多种下游任务中达到最先进性能,包括词性标注、命名实体识别、语法错误检测和成分句法分析。为训练这些模型,我们引入了冰岛语文本新语料库——冰岛 Common Crawl 语料库(IC3),这是通过定向冰岛顶级域名(TLD)在线收集的高质量文本集合。我们还汇集了若干其他公共数据源,共计16GB冰岛语文本。为增强模型性能评估并提升冰岛语基线水平,我们翻译并改编了 WinoGrande 数据集用于共指消解。通过这些努力,我们证明,与在精选语料库上训练的模型相比,适当清理的爬取语料库足以在低到中资源语言的 NLP 应用中取得最先进结果。我们进一步表明,使用现有多语言模型初始化模型可使某些下游任务达到最先进结果。
引用
@article{arxiv.2201.05601,
title = {A Warm Start and a Clean Crawled Corpus -- A Recipe for Good Language Models},
author = {Vésteinn Snæbjarnarson and Haukur Barri Símonarson and Pétur Orri Ragnarsson and Svanhvít Lilja Ingólfsdóttir and Haukur Páll Jónsson and Vilhjálmur Þorsteinsson and Hafsteinn Einarsson},
journal= {arXiv preprint arXiv:2201.05601},
year = {2022}
}