中文

PreAlign:通过早期建立多语言对齐来提升跨语言迁移

计算与语言 2024-11-19 v3

摘要

大型语言模型尽管主要以英语为中心进行预训练,却展现出相当的多语言能力。然而,这些模型中出现的自然多语言对齐被证明较为薄弱,导致跨语言迁移和知识共享表现不佳。以往的工作试图通过在预训练期间或之后显式注入多语言对齐信息来解决此问题。因此,在预训练的早期阶段,对齐仍然薄弱,难以在不同语言之间共享信息或知识。本文提出了 PreAlign 框架,在语言模型预训练前建立多语言对齐。PreAlign 通过初始化模型以生成对齐词语的相似表征,并在预训练期间采用代码切换策略来保持这种对齐。大量实验在合成的英语到英语克隆语言设置中表明,PreAlign 在语言建模、零样本跨语言迁移和跨语言知识应用方面显著优于标准的多语言联合训练。进一步的实验在真实场景下进一步验证了 PreAlign 在 various 模型规模下的有效性。

关键词

引用

@article{arxiv.2407.16222,
  title  = {PreAlign: Boosting Cross-Lingual Transfer by Early Establishment of Multilingual Alignment},
  author = {Jiahuan Li and Shujian Huang and Aarron Ching and Xinyu Dai and Jiajun Chen},
  journal= {arXiv preprint arXiv:2407.16222},
  year   = {2024}
}