无需训练即可增益:用于免训练语言适配器增强的语言算术
计算与语言
2024-09-10 v2
摘要
模块化深度学习是解决多语言诅咒、防止负干扰影响以及实现多语言预训练语言模型跨语言性能的最先进解决方案。然而,这种方法的一个权衡是减少了来自密切相关语言的正迁移学习。为此,我们引入了一种称为语言算术的新方法,该方法能够实现无需训练的后处理以解决这一局限性。扩展任务算术框架,我们将通过加法学习应用于语言适配器,将框架从多任务设置过渡到多语言设置。所提出解决方案的有效性在基于MAD-X的跨语言方案中的三个下游任务上得到了证明,作为后处理程序。语言算术持续改进了基线,取得了显著提升,尤其是在最具挑战性的零样本应用场景中。我们的代码和模型可在https://github.com/mklimasz/language-arithmetic获取。
引用
@article{arxiv.2404.15737,
title = {No Train but Gain: Language Arithmetic for training-free Language Adapters enhancement},
author = {Mateusz Klimaszewski and Piotr Andruszkiewicz and Alexandra Birch},
journal= {arXiv preprint arXiv:2404.15737},
year = {2024}
}