中文

多语言无监督序列分割可迁移至极低资源语言

计算与语言 2022-03-16 v2

摘要

我们表明,通过对掩蔽分段语言模型(Downey 等,2021)进行多语言预训练,可将无监督序列分割性能迁移至极低资源语言。此外,我们表明这种迁移可通过在一组与目标语言类型学相似(但系统发生上无关)的低资源语言上训练来实现。在我们的实验中,我们从一组 10 种美洲原住民语言(AmericasNLP,Mager 等,2021)向玛雅语言 K'iche' 迁移。我们将多语言模型与单语(从头训练)基线以及仅在 Quechua 上预训练的模型进行比较。我们表明,多语言预训练方法在目标数据集规模下产生一致的分割质量,在 10/10 实验设置中的 6 种下超越单语基线。我们的模型在小型目标规模下尤其表现强劲,包括零样本性能达 20.6 F1。这些结果对涉及类人语言单元(如 Bird(2020)提出的稀疏转写框架)的低资源 NLP 流程具有广阔启示。

关键词

引用

@article{arxiv.2110.08415,
  title  = {Multilingual unsupervised sequence segmentation transfers to extremely low-resource languages},
  author = {C. M. Downey and Shannon Drizin and Levon Haroutunian and Shivin Thukral},
  journal= {arXiv preprint arXiv:2110.08415},
  year   = {2022}
}

备注

ACL 2022 camera-ready