中文

预训练多语言序列到序列模型:低资源语言翻译的希望?

计算与语言 2022-05-03 v3

摘要

像 mBART 这样的预训练多语言序列到序列模型能为低资源语言翻译带来什么?我们在 10 种语言中进行了详尽的实证实验以探明这一点,考量五个因素:(1) 微调数据量,(2) 微调数据中的噪声,(3) 模型中预训练数据量,(4) 领域失配的影响,以及 (5) 语言类型学。除得出若干启发式结论外,实验构成了评估机器翻译系统数据敏感性的框架。尽管 mBART 对领域差异具有鲁棒性,其对未见且与类型学疏远的语言的翻译仍低于 3.0 BLEU。对于我们标题所提问题的回答是:mBART 并非低资源万灵药;因此我们鼓励将重心从新模型转向新数据。

关键词

引用

@article{arxiv.2203.08850,
  title  = {Pre-Trained Multilingual Sequence-to-Sequence Models: A Hope for Low-Resource Language Translation?},
  author = {En-Shiun Annie Lee and Sarubi Thillainathan and Shravan Nayak and Surangika Ranathunga and David Ifeoluwa Adelani and Ruisi Su and Arya D. McCarthy},
  journal= {arXiv preprint arXiv:2203.08850},
  year   = {2022}
}

备注

Accepted to Findings of ACL 2022