中文

多低才算过低?从计算视角看极低资源语言

计算与语言 2021-06-01 v1

摘要

尽管基于注意力的深度学习架构在多数自然语言处理任务上取得近期进展,由于缺乏此类语言的预训练模型,其应用在低资源设定下仍受限。本研究中,我们首次尝试探究将这些技术适配于一种极低资源语言——苏美尔楔形文字(世界上最古老的书写语言之一,至少自公元前三千年之初即有证)的挑战。具体而言,我们引入首个面向苏美尔语的跨语言信息抽取流水线,包括词性标注、命名实体识别与机器翻译。我们进一步策划 InterpretLR,一个面向低资源 NLP 的可解释性工具包,并将其与人工归因一同使用以理解模型。我们强调以人工评估来度量我们所有技术。值得注意的是,我们流水线的多数组件可泛化至任意其他语言,以获得技术的可解释执行,尤其在低资源设定下。我们公开发布所有软件、模型检查点,以及一个带有领域特定预处理的新型数据集以促进进一步研究。

关键词

引用

@article{arxiv.2105.14515,
  title  = {How Low is Too Low? A Computational Perspective on Extremely Low-Resource Languages},
  author = {Rachit Bansal and Himanshu Choudhary and Ravneet Punia and Niko Schenk and Jacob L Dahl and Émilie Pagé-Perron},
  journal= {arXiv preprint arXiv:2105.14515},
  year   = {2021}
}

备注

ACL SRW 2021