面向方言阿拉伯语机器翻译的上下文感知框架:基于可交互区域与社会语体选择
计算与语言
2026-04-09 v1
摘要
当前的阿拉伯语机器翻译系统常常难以考虑方言多样性,频繁将方言输入同化为现代标准阿拉伯语 (MSA),且对目标方言语种缺乏用户控制。本文提出一种面向方言阿拉伯语机器翻译的、具备上下文感知和可调控性的框架,显式建模区域和社会语言变异。我们的主要技术贡献是一种基于规则的数据增强 (RBDA) 流程,将一个包含 3000 句子的数据种子扩展为覆盖八个地区变体(包括埃及方言、黎巴嫩-叙利亚方言、海湾方言等)的平行语料库,规模达 57,000 句。通过在 mT5-base 模型上进行微调,并以轻量级元数据标签为条件,我们的方法实现了跨方言和社会语体的可控生成。结合自动评估和定性分析,我们观察到一种准确性与保真度之间的权衡:高资源基准模型(如 NLLB)通过默认向 MSA 均值实现更高的整体 BLEU 分数 (13.75),但表现出有限的方言特异性;而我们的方法虽 BLEU 分数较低 (8.19),但生成的输出更贴近预期的地区变体。支持性定性评估,包括 LLM 辅助的文化真实性分析,表明我们的模型在方言对齐方面优于基线系统 (4.80/5 vs. 1.0/5)。这些发现凸显了针对方言敏感任务的标准 MT 指标的局限性,动力需求更能反映阿拉伯语机器翻译中语言多样性的评估实践。
引用
@article{arxiv.2604.06456,
title = {Context-Aware Dialectal Arabic Machine Translation with Interactive Region and Register Selection},
author = {Afroza Nowshin and Prithweeraj Acharjee Porag and Haziq Jeelani and Fayeq Jeelani Syed},
journal= {arXiv preprint arXiv:2604.06456},
year = {2026}
}
备注
14 pages, 5 figures, 5 tables. Preprint under review