OSN-MDAD:面向在线社交媒体阿拉伯语多方言对话的机器翻译数据集
计算与语言
2023-09-22 v1 人工智能
摘要
尽管英语资源已相当充足以理解社交媒体内容,阿拉伯语的类似资源仍不成熟。阿拉伯语资源不足的主要原因是除标准语(MSA)外,阿拉伯语拥有众多方言。阿拉伯人在日常交流中不使用 MSA,而是使用方言版本。遗憾的是,社交用户将这一现象带入其社交媒体平台的使用中,进而迫切需要对语言相关应用构建合适的 AI 模型。现有为 MSA 设计的机器翻译(MT)系统无法很好地处理阿拉伯语方言。有鉴于此,有必要通过开发能有效处理阿拉伯语各种方言的 MT 系统,来适应社交网络上非正式交流的特性。与 MSA 在 MT 系统中展现的先进进展不同,利用阿拉伯语方言构建 MT 系统的努力甚少。虽有少量尝试构建方言阿拉伯语翻译数据集,但它们依赖特定领域且对 OSN 文化语言不友好。本工作中,我们试图通过提出一个基于在线社交网络的多方言阿拉伯语数据集来缓解这些局限,该数据集通过将英文推文语境化翻译为四种阿拉伯语方言(海湾、也门、伊拉克和黎凡特)精心构建。为执行翻译,我们遵循所提出的文本内容翻译指导框架,该框架可普遍适用于外语与本地方言间的翻译。我们通过为四种阿拉伯语方言开发神经 MT 模型验证了所提数据集的真实性。我们的结果显示,使用我们的数据集训练的神经机器翻译(NMT)模型具有优越性能。我们相信该数据集可可靠地作为用于非正式 MT 任务的阿拉伯语多方言翻译数据集。
引用
@article{arxiv.2309.12137,
title = {OSN-MDAD: Machine Translation Dataset for Arabic Multi-Dialectal Conversations on Online Social Media},
author = {Fatimah Alzamzami and Abdulmotaleb El Saddik},
journal= {arXiv preprint arXiv:2309.12137},
year = {2023}
}