面向机器翻译的阿拉伯方言自动标准化
计算与语言
2023-01-10 v1
摘要
基于标注多媒体语料库(2013 年电视剧 Marāyā),我们深入探讨面向机器翻译的阿拉伯方言“自动标准化”问题。此处我们区分基于规则的机器翻译与统计机器翻译。以阿拉伯语为源的机器翻译多数以标准阿拉伯语或现代阿拉伯语作为源语言,并因具备训练模型所需的翻译记忆而产出相当满意的译文。阿拉伯方言的翻译情况则不同,其产出效率低得多。在我们的研究中,我们尝试将机器翻译方法应用于方言/标准(或现代)阿拉伯语配对,以从方言输入自动生成标准阿拉伯语文本,我们将此过程称为“自动标准化”。我们选择应用“统计模型”,因为一方面缺乏“双语双层”词典,另一方面难以为每种方言制定语言规则,基于规则的“自动标准化”更为困难。开展本研究可进而将“自动标准化”软件与自动翻译软件结合,以第一软件的输作为第二软件的输入,最终获得高质量的机器翻译。该方法亦可有教育应用,例如通过将方程方言文本转为标准阿拉伯语来开发帮助理解不同阿拉伯方言的应用。
引用
@article{arxiv.2301.03447,
title = {Automatic Standardization of Arabic Dialects for Machine Translation},
author = {Abidrabbo Alnassan},
journal= {arXiv preprint arXiv:2301.03447},
year = {2023}
}