中文

Transformer 语言适配器的隐藏空间

计算与语言 2024-06-11 v2

摘要

我们分析了 Transformer 语言适配器的运作机制,这些适配器是训练在冻结语言模型之上的小型模块,用于将其预测适应新的目标语言。我们表明,适应后的预测主要在模型训练的源语言中演变,而目标语言仅在模型的非常最后的层中变得显著。此外,适应过程是渐进的并分布于各层,其中可以跳过小的适配器组而不降低适应性能。最后,我们表明适配器在模型的冻结表示空间之上运作,同时很大程度上保留了其结构,而不是在一个“孤立”的子空间上运作。我们的发现提供了对语言模型适应新语言过程的更深入视角,展示了底层模型对其施加的约束,并引入了提高其效率的实际意义。

关键词

引用

@article{arxiv.2402.13137,
  title  = {The Hidden Space of Transformer Language Adapters},
  author = {Jesujoba O. Alabi and Marius Mosbach and Matan Eyal and Dietrich Klakow and Mor Geva},
  journal= {arXiv preprint arXiv:2402.13137},
  year   = {2024}
}

备注

Accepted to ACL 2024 (main conference)