马格里布阿拉伯语次方言的标符复原
计算与语言
2019-06-03 v3
摘要
标符复原(diacritization)过程试图恢复阿拉伯文书写文本中通常被省略的短元音。该过程对于文本转语音(TTS)等应用至关重要。尽管现代标准阿拉伯语(MSA)的标符复原仍占主要份额,但关于方言阿拉伯语(DA)标符复原的研究非常有限。在本文中,我们展示在马格里布阿拉伯语两个次方言——即突尼斯语和摩洛哥语——的自动标符复原上的贡献与结果,使用一种在 CRF 输出层上堆叠两个 bi-LSTM 层的字符级深度神经网络架构。该模型对摩洛哥语和突尼斯语分别取得 2.7% 和 3.6% 的词错误率,并能够隐式识别输入的次方言。
引用
@article{arxiv.1810.06619,
title = {Diacritization of Maghrebi Arabic Sub-Dialects},
author = {Ahmed Abdelali and Mohammed Attia and Younes Samih and Kareem Darwish and Hamdy Mubarak},
journal= {arXiv preprint arXiv:1810.06619},
year = {2019}
}
备注
6 pages, 3 figures