面向数据不平衡的多语言翻译的鲁棒优化
计算与语言
2021-12-01 v4 人工智能
机器学习
摘要
多语言模型参数高效,尤其能通过利用跨语言迁移来改进低资源语言。尽管近期在大规模多语言翻译方面随着模型与数据的不断增长取得了进展,如何有效训练多语言模型仍未被充分理解。本文中,我们指出多语言训练中的一种常见情形——各语言间的数据不平衡——会在高资源与低资源语言之间造成优化张力,使得所得的多语言解对低资源语言往往次优。我们表明,对低资源语言进行上采样的常见训练方法无法鲁棒地优化总体损失,存在高资源语言欠拟合或低资源语言过拟合的风险。借鉴近期关于损失景观几何及其对泛化影响的研究发现,我们提出一种有原则的优化算法——曲率感知任务缩放(Curvature Aware Task Scaling, CATS),它利用引导多语言训练走向所有语言均匀低损失的低曲率邻域的元目标,自适应地重新缩放来自不同任务的梯度。我们在具有不同程度数据不平衡的常用基准(TED、WMT 和 OPUS-100)上进行了实验。CATS 有效改进了多语言优化,并因此在低资源语言上展现出一致的提升( 至 BLEU)且不损害高资源语言。此外,CATS 对过参数化和大批量训练具有鲁棒性,使其成为真正改进低资源语言的大规模多语言模型的一种有前景的训练方法。
引用
@article{arxiv.2104.07639,
title = {Robust Optimization for Multilingual Translation with Imbalanced Data},
author = {Xian Li and Hongyu Gong},
journal= {arXiv preprint arXiv:2104.07639},
year = {2021}
}