打破物理与语言边界:面向低资源语言的多语言联邦提示调优
计算与语言
2025-07-08 v1
摘要
预训练大型语言模型(LLM)已成为现代自然语言处理领域的基石,其能力跨越广泛的应用场景和语言。然而,针对低资源语言的多语言LLM微调面临显著挑战,主要源于数据共享限制(物理边界)以及内在语言差异(语言边界)。这些障碍阻碍了各语言用户,尤其是低资源地区用户,充分受益于LLM的优势。为此,我们提出了面向多语言场景的联邦提示调优范式,利用参数高效微调方法,遵循数据共享限制。我们设计了一套全面的实验,并通过一种新颖的语言距离概念进行分析,以凸显该范式的优势:在计算约束条件下,我们的方法不仅提高了数据效率,还促进了语言之间的相互增强,尤其受益于低资源语言。与传统的本地跨语言迁移调优方法相比,我们的方法在准确率上提升了6.9%,数据效率更高,稳定性和泛化性更强。这些发现凸显了该方法潜力,助力社会平等,捍卫语言多样性,确保不留下任何语言。
引用
@article{arxiv.2507.03003,
title = {Breaking Physical and Linguistic Borders: Multilingual Federated Prompt Tuning for Low-Resource Languages},
author = {Wanru Zhao and Yihong Chen and Royson Lee and Xinchi Qiu and Yan Gao and Hongxiang Fan and Nicholas D. Lane},
journal= {arXiv preprint arXiv:2507.03003},
year = {2025}
}
备注
ICLR 2024