面向Lugha-Llama的定向词汇注入:通过早期层LoRA微调实现跨语言对齐
摘要
大型语言模型(LLM)已展现出惊人的能力,但在低资源语言(LRL)如斯瓦希利语方面的性能常常落后,原因在于数据稀缺且在预训练中被低估。一个关键挑战是实现稳健的跨语言词汇对齐,这对于翻译和跨语言信息检索等任务至关重要。本文引入了定向词汇注入(TLI),这是一种新颖且高效的微调方法。我们首先表明,Lugha-Llama-8B-wura这一斯瓦希利语中心的LLM在其早期内部层(具体为第2层, pilot研究中平均余弦相似度约为0.99998)中展现出强劲且近乎完美的斯瓦希利语-英语词对的跨语言词汇对齐能力,而这种能力并未在其最终输出表示中得到充分体现(基线测试集上约为0.32的相似度)。TLI利用这一洞见,通过采用低秩适应(LoRA)和对比学习目标,对该经验上确定的最佳早期层进行微调,专门针对该层的嵌入进行优化。我们的实验表明,TLI显著提高了对623个训练好的斯瓦希利语-英语词对的输出层词汇对齐性能,将平均余弦相似度从0.3211提升至0.4113(提升28.08%,)。更重要的是,这些改进对63个未见控制词对也能 remarkably好地泛化,相似度从0.3143提升至0.4033(提升28.32%,)。这些发现表明,TLI增强了模型保留和传递其内在早期层跨语言知识的能力,为改善面向LRL的LLM的词汇对齐提供了一种参数高效且有效的策略。
引用
@article{arxiv.2506.15415,
title = {Targeted Lexical Injection: Unlocking Latent Cross-Lingual Alignment in Lugha-Llama via Early-Layer LoRA Fine-Tuning},
author = {Stanley Ngugi},
journal= {arXiv preprint arXiv:2506.15415},
year = {2025}
}
备注
11 pages, 3 figures, 2 tables. Research on parameter-efficient fine-tuning (PEFT) for low-resource languages (Swahili). Investigates cross-lingual lexical alignment in Lugha-Llama using LoRA and contrastive learning