中文

Saudi-Dialect-ALLaM: LoRA Fine-Tuning for Dialectal Arabic Generation

计算与语言 2025-08-20 v1 机器学习

摘要

阿拉伯语大型语言模型(LLM)仍以现代标准阿拉伯语(MSA)为主,对于如纳赊语和 Hijazi 语等沙特方言支持有限。这种代表性不足阻碍了其捕捉真实方言变异的能力。我们使用私人精选的沙特方言指令数据集(Hijazi 和 Najdi;5,466 条人工合成指令-响应对;50/50 分割),对 ALLaM-7B-Instruct-preview 进行 LoRA 微调,后者是沙特阿拉伯首个基础模型,用于沙特方言生成。我们检验两种变体:(i) Dialect-Token 训练,通过在指令前添加显式方言标签实现;(ii) No-Token 训练,在格式化时省略标签。评估在留置测试集上进行,结合外部方言分类器与文本保真度指标(chrF++ 和 BERTScore)以及多样性度量。Dialect-Token 模型实现最佳控制,将沙特语比例提升至 84.21%,将 MSA 漏洞降至 6.21%;保真度亦得到提升(chrF++ 提升 3.53,BERTScore 提升 0.059)。两种 LoRA 变体均优于强大的通用指令模型(Falcon-7B-Instruct、Llama-3.1-8B-Instruct、Qwen-2.5-7B-Instruct、AceGPT-v2-8B-Chat、JAIS-13B-Chat)在方言控制和保真度方面,同时避免了这些基线模型经常出现的元数据标签回显问题。我们不发布数据集或任何模型权重/适配器;相反,我们发布训练/评估/推理代码及详细数据表(模式和聚合统计信息),以支持独立验证。

关键词

引用

@article{arxiv.2508.13525,
  title  = {Saudi-Dialect-ALLaM: LoRA Fine-Tuning for Dialectal Arabic Generation},
  author = {Hassan Barmandah},
  journal= {arXiv preprint arXiv:2508.13525},
  year   = {2025}
}

备注

7 pages, 6 figures, 2 tables. Code: https://github.com/HasanBGIt/Saudi-Dialect-ALLaM . Dataset and trained weights/adapters are not released. Primary category: cs.CL