BERTić——面向波斯尼亚语、克罗地亚语、黑山语和塞尔维亚语的 Transformer 语言模型
计算与语言
2021-04-20 v1
摘要
本文描述了一种在来自克罗地亚、波斯尼亚、塞尔维亚和黑山网络域的 80 亿词爬取文本上预训练的 transformer 模型。我们在词性标注、命名实体识别、地理位置预测和常识因果推理任务上评估该 transformer 模型,显示出在所有任务上相较最先进模型均有提升。对于常识推理评估,我们引入了 COPA-HR——即可信替代选项选择(COPA)数据集的克罗地亚语翻译。BERTić 模型通过 HuggingFace 免费提供使用并支持进一步的任务特定微调。
引用
@article{arxiv.2104.09243,
title = {BERTi\'c -- The Transformer Language Model for Bosnian, Croatian, Montenegrin and Serbian},
author = {Nikola Ljubešić and Davor Lauc},
journal= {arXiv preprint arXiv:2104.09243},
year = {2021}
}