中文

方言阿拉伯语向现代标准阿拉伯语机器翻译的提升

计算与语言 2025-09-04 v2

摘要

方言阿拉伯语(DA)始终是自然语言处理(NLP)中的一个持久挑战,因为阿拉伯世界日常交流大多发生在与现代标准阿拉伯语(MSA)差异显著的方言中。这一语言鸿沟阻碍了阿拉伯语机器翻译的进展。本文为阿拉伯语方言(包括黎巴嫩、埃及和 Gulf 方言)在低资源和计算受限环境下的 DA-MSA 翻译提供了两个核心贡献:(i)对训练-free 提示技术的全面评估,和(ii)开发一种资源高效的微调管道。我们在六个大型语言模型(LLM)上评估了提示策略,发现零样本、少样本、链律推理和我们提出的 Ara-TEaR 方法中,少样本提示始终表现最佳。Ara-TEaR 旨作为三阶段自我细化提示过程,针对 DA-MSA 翻译中常见的语义传递和适应错误。我们的评估显示,GPT-4o 在所有提示设置下均取得最佳性能。对于 LLM 微调,量化的 Gemma2-9B 模型获得了 49.88 的 chrF++ 分数,优于零样本 GPT-4o(44.58)。联合多方言训练的模型在 chrF++ 上比单方言模型高出超过 10%,而 4 位量化将内存使用降低 60%,且性能损失不足 1%。本实验的结果与洞见为改进阿拉伯语 NLP 中的方言包容性提供了实用蓝图,表明即使在有限资源下,高质量的 DA-MSA 机器翻译也已可实现,为更包容的语言技术铺平了道路。

关键词

引用

@article{arxiv.2507.20301,
  title  = {Advancing Dialectal Arabic to Modern Standard Arabic Machine Translation},
  author = {Abdullah Alabdullah and Lifeng Han and Chenghua Lin},
  journal= {arXiv preprint arXiv:2507.20301},
  year   = {2025}
}