中文

利用多语言编码器提升低资源语言大语言模型性能

计算与语言 2025-11-11 v3

摘要

大语言模型(LLMs)在英文方面表现卓越,但在低资源语言(LRLs)上性能会显著下降,这是由于其英语中心化的训练所致。虽然LangBridge等方法利用诸如Massively Multilingual Text-to-Text Transfer Transformer(mT5)等多语言编码器来对齐LLMs,但通常仅使用最终编码器层。我们提出一种新型架构,将所有中间层融合,从而丰富传递给LLM的语言信息。我们的方法包含两个策略:i)全局Softmax加权用于整体层重要性;ii)Transformer Softmax模型学习基于token的特定权重。融合后的表示被映射到LLM的嵌入空间,从而使其能够处理多语言输入。该模型仅在英文数据上进行训练,不使用任何平行或多语言数据。在XNLI、IndicXNLI、Sinhala新闻分类和Amazon评论等数据集上评估,我们的Transformer Softmax模型显著优于LangBridge基线。我们观察到在LRLs方面的显著性能提升,将Sinhala分类准确率从71.66%提升至75.86%,并在泰米尔、孟加拉和马来alam等印度语言方面实现明显改进。这些具体提升为XNLI平均准确率从70.36%提升至71.50%提供了贡献。这一方法为实现更具能力和公平性的多语言LLMs提供了可扩展且高效的数据路径。

关键词

引用

@article{arxiv.2508.09091,
  title  = {Utilizing Multilingual Encoders to Improve Large Language Models for Low-Resource Languages},
  author = {Imalsha Puranegedara and Themira Chathumina and Nisal Ranathunga and Nisansa de Silva and Surangika Ranathunga and Mokanarangan Thayaparan},
  journal= {arXiv preprint arXiv:2508.09091},
  year   = {2025}
}