中文

低资源方言适配大型语言模型:法语方言案例研究

计算与语言 2026-03-02 v3 人工智能

摘要

尽管大型语言模型 (LLM) 已广泛采用,但其最强能力仍主要局限于少数几种高资源语言,这些语言拥有丰富的训练数据。最近,持续预训练 (CPT) 作为一种针对低资源地区方言微调这些模型的方法而涌现。本文研究在有限数据和计算资源预算下,使用 CPT 进行方言学习。我们采用低秩适应 (LoRA) 和计算高效持续预训练,将三个 LLM 适配到法语皮埃尔 (Québec French) 方言上,并在 COLE 测试套件上进行基准测试。我们的实验在少数方言基准上实现改进,同时在主流语言基准上几乎不退化,仅更新约 1% 的模型参数。结果分析表明,收益在语料构成高度依赖于语料的选择。这些发现表明,CPT 与参数高效微调 (PEFT) 可通过提供成本效益高的语言资源创建,扩大高质量 LLM 访问到少数语言社区的范围。为支持可重复性并拓宽访问,我们发布了首个法语皮埃尔 LLM 至 Hugging Face。

关键词

引用

@article{arxiv.2510.22747,
  title  = {Low-Resource Dialect Adaptation of Large Language Models: A French Dialect Case-Study},
  author = {Eeham Khan and Firas Saidani and Owen Van Esbroeck and Richard Khoury and Leila Kosseim},
  journal= {arXiv preprint arXiv:2510.22747},
  year   = {2026}
}

备注

Accepted at LREC 2026