梯度疫苗:大规模多语言模型中多任务优化的研究与改进
计算与语言
2020-10-13 v1 机器学习
摘要
涵盖数十甚至数百种语言的大规模多语言模型给多任务优化带来巨大挑战。尽管采用语言无关的过程优化联合多语言任务目标已是常见做法,如何恰当刻画并利用其底层问题结构以提升优化效率仍鲜有探索。本文试图通过损失函数几何的视角窥探多语言优化的黑箱。我们发现,沿优化轨迹度量的梯度相似度是一个重要信号,它不仅与语言亲疏度良好相关,也与整体模型性能密切相关。该观察帮助我们识别出现有基于梯度的多任务学习方法的严重局限,从而推导出名为 Gradient Vaccine 的简单且可扩展的优化过程,其鼓励相近任务进行几何上更对齐的参数更新。在经验上,我们的方法在多语言机器翻译及多语言语言模型的 XTREME 基准任务上取得显著模型性能提升。我们的工作揭示了在多语言优化中恰当度量并利用语言亲疏度的重要性,并对超越多语言建模的多任务学习具有更广泛启示。
引用
@article{arxiv.2010.05874,
title = {Gradient Vaccine: Investigating and Improving Multi-task Optimization in Massively Multilingual Models},
author = {Zirui Wang and Yulia Tsvetkov and Orhan Firat and Yuan Cao},
journal= {arXiv preprint arXiv:2010.05874},
year = {2020}
}