Transformer 语言适配器的隐藏空间
计算与语言
2024-06-11 v2
摘要
我们分析了 Transformer 语言适配器的运作机制,这些适配器是训练在冻结语言模型之上的小型模块,用于将其预测适应新的目标语言。我们表明,适应后的预测主要在模型训练的源语言中演变,而目标语言仅在模型的非常最后的层中变得显著。此外,适应过程是渐进的并分布于各层,其中可以跳过小的适配器组而不降低适应性能。最后,我们表明适配器在模型的冻结表示空间之上运作,同时很大程度上保留了其结构,而不是在一个“孤立”的子空间上运作。我们的发现提供了对语言模型适应新语言过程的更深入视角,展示了底层模型对其施加的约束,并引入了提高其效率的实际意义。
引用
@article{arxiv.2402.13137,
title = {The Hidden Space of Transformer Language Adapters},
author = {Jesujoba O. Alabi and Marius Mosbach and Matan Eyal and Dietrich Klakow and Mor Geva},
journal= {arXiv preprint arXiv:2402.13137},
year = {2024}
}
备注
Accepted to ACL 2024 (main conference)