GradSim:基于梯度相似度的语言分组以实现高效多语言训练
机器学习
2023-10-25 v1 计算与语言
摘要
世界上大多数语言对自然语言处理模型构成了低资源挑战。通过多语言训练,知识可在语言间共享。然而,并非所有语言都彼此产生正向影响,如何为 multilingual 训练选取最适宜的语言集合、并避免特征或数据分布不相容语言间的负干扰,仍是一个开放的研究问题。本文提出 GradSim,一种基于梯度相似度(gradient similarity)的语言分组方法。我们在三个不同的多语言基准数据集上的实验表明,相较于其他相似度度量,该方法带来最大的性能增益,且与跨语言模型性能的相关性更好。据此,我们在 AfriSenti(一个面向低资源非洲语言情感分析的基准数据集)上确立了新的 SOTA。在详尽分析中,我们进一步揭示:除语言特征外,数据集的主题对语言分组亦起重要作用,且 transformer 模型的较低层编码语言特定特征,而较高层捕获任务特定信息。
引用
@article{arxiv.2310.15269,
title = {GradSim: Gradient-Based Language Grouping for Effective Multilingual Training},
author = {Mingyang Wang and Heike Adel and Lukas Lange and Jannik Strötgen and Hinrich Schütze},
journal= {arXiv preprint arXiv:2310.15269},
year = {2023}
}