通过近缘语言迁移至低资源语言:以法罗语为例
计算与语言
2023-04-19 v1
摘要
多语言语言模型推动了跨语言自然语言处理迁移的最先进水平。然而,大多数零样本跨语言迁移都使用同一个大规模多语言 transformer(例如 mBERT 或 XLM-R)来迁移到所有目标语言,而不考虑它们与其他语言在类型学、词源学和系统发育上的关系。特别是,资源丰富的兄弟语言中现成的数据和模型常被忽视。在这项工作中,我们通过以法罗语(一种来自高资源语系的语言家族的低资源语言)为案例研究,实证表明,通过利用系统发育信息并摆脱“一刀切”范式,可以改善对低资源语言的跨语言迁移。具体而言,我们利用其他斯堪的纳维亚语言(即丹麦语、挪威语、瑞典语和冰岛语)的丰富资源来惠及法罗语。我们的评估结果表明,通过利用密切相关的高资源语言的数据和模型,我们可以大幅提升对法罗语的迁移性能。此外,我们发布了一个新的法罗语网络语料库以及用于命名实体识别(NER)、语义文本相似度(STS)的法罗语数据集,还有在所有斯堪的纳维亚语言上训练的新语言模型。
引用
@article{arxiv.2304.08823,
title = {Transfer to a Low-Resource Language via Close Relatives: The Case Study on Faroese},
author = {Vésteinn Snæbjarnarson and Annika Simonsen and Goran Glavaš and Ivan Vulić},
journal= {arXiv preprint arXiv:2304.08823},
year = {2023}
}