中文

面向尼日利亚皮钦语的低资源跨语言自适应训练

计算与语言 2023-07-04 v1

摘要

由于缺乏平行数据以及用于微调模型的有限资源,为低资源语言开发有效的口语处理系统带来了若干挑战。在这项工作中,我们旨在通过收集大规模英-皮钦平行语料库来改进尼日利亚皮钦语(Naija)的文本分类与翻译,并进一步提出一种跨语言自适应训练框架,其包含持续训练与任务自适应训练,以将基础预训练模型适配到低资源语言。我们的研究表明,在英语-皮钦任务上,英语预训练语言模型比多语言语言模型作为更强的先验,带来最高 2.38 BLEU 的提升;并证明扩充正字法数据以及使用带回译的任务自适应训练可对模型性能产生显著影响。

关键词

引用

@article{arxiv.2307.00382,
  title  = {Low-Resource Cross-Lingual Adaptive Training for Nigerian Pidgin},
  author = {Pin-Jie Lin and Muhammed Saeed and Ernie Chang and Merel Scholman},
  journal= {arXiv preprint arXiv:2307.00382},
  year   = {2023}
}

备注

To appear in INTERSPEECH 2023