评估 BERT 模型在乌拉尔语系语言上的可迁移性
计算与语言
2021-11-24 v2
摘要
基于 Transformer 的语言模型(如 BERT)已在大量英语基准上超越先前的模型,但其评估常局限于英语或少数资源丰富的语言。本工作中,我们评估了 BERT 系列中的单语、多语和随机初始化语言模型在多种乌拉尔语上的表现,包括爱沙尼亚语、芬兰语、匈牙利语、埃尔齐亚语、莫克沙语、卡累利阿语、利维语、彼尔姆科米语、齐良科米语、北萨米语和斯科尔特萨米语。当单语模型可用时(目前仅有 et、fi、hu),这些模型在其母语上表现更好,但总体上它们比多语模型或共享相同字符集但遗传无关的语言模型迁移更差。值得注意的是,高资源模型的直接迁移,即便未特别进行超参数优化,也为有充足数据微调的少数乌拉尔语 minority 语言产生了看似最先进的 POS 与 NER 工具。
引用
@article{arxiv.2109.06327,
title = {Evaluating Transferability of BERT Models on Uralic Languages},
author = {Judit Ács and Dániel Lévai and András Kornai},
journal= {arXiv preprint arXiv:2109.06327},
year = {2021}
}
备注
Seventh International Workshop for Computational Linguistics of Uralic Languages (IWCLUL 2021)