中文

面向低资源语言的大语言模型鲁健性多语言适应

计算与语言 2026-05-19 v3 人工智能

摘要

大语言模型(LLMs)在低资源语言方面仍面临挑战,主要原因是训练数据有限、翻译噪声以及跨语言对齐不稳定。为此,我们提出了LiRA(Linguistic Robust Anchoring for LLMs)——一个即插即用的框架,仅需在现有预训练模型之上进行轻量级微调。LiRA通过两种关键组件实现表示稳定性和跨语言语义一致性:Arca(Anchored Representation Composition Architecture)通过锚定对齐和协作编码,将低资源输入对齐到共享的英文语义空间;LaSR(Language-coupled Semantic Reasoner)是一种轻量级、语言感知的头部,通过一致性正则化实现统一的跨语言理解、检索和推理。我们在受控锚定误差和翻译引起的偏差下,理论上证明LiRA保证了表示偏差的有界性以及在局部 Lipschitz 连续性下的稳定下游性能。为促进研究,我们发布了一个新的多语言产品检索数据集,覆盖五种东南亚语言和两种南亚语言。广泛的实验在多样化的低资源基准上表明,检索、排序、问答和推理任务均实现了持续的性能提升。代码将在GitHub上公开,数据集将在Hugging Face上提供。

关键词

引用

@article{arxiv.2510.14466,
  title  = {Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages},
  author = {Haolin Li and Haipeng Zhang and Mang Li and Yaohua Wang and Lijie Wen and Yu Zhang and Biqing Huang},
  journal= {arXiv preprint arXiv:2510.14466},
  year   = {2026}
}

备注

Accepted by ICML 2026