预训练多语言序列到序列模型:低资源语言翻译的希望?
计算与语言
2022-05-03 v3
摘要
像 mBART 这样的预训练多语言序列到序列模型能为低资源语言翻译带来什么?我们在 10 种语言中进行了详尽的实证实验以探明这一点,考量五个因素:(1) 微调数据量,(2) 微调数据中的噪声,(3) 模型中预训练数据量,(4) 领域失配的影响,以及 (5) 语言类型学。除得出若干启发式结论外,实验构成了评估机器翻译系统数据敏感性的框架。尽管 mBART 对领域差异具有鲁棒性,其对未见且与类型学疏远的语言的翻译仍低于 3.0 BLEU。对于我们标题所提问题的回答是:mBART 并非低资源万灵药;因此我们鼓励将重心从新模型转向新数据。
引用
@article{arxiv.2203.08850,
title = {Pre-Trained Multilingual Sequence-to-Sequence Models: A Hope for Low-Resource Language Translation?},
author = {En-Shiun Annie Lee and Sarubi Thillainathan and Shravan Nayak and Surangika Ranathunga and David Ifeoluwa Adelani and Ruisi Su and Arya D. McCarthy},
journal= {arXiv preprint arXiv:2203.08850},
year = {2022}
}
备注
Accepted to Findings of ACL 2022