基于深度神经网络的阿拉伯语文本标音
计算与语言
2019-05-07 v1 机器学习
摘要
阿拉伯语文本标音既是一个有趣的问题,同时又是一个具有挑战性的问题,其应用范围从语音合成到帮助学生学习阿拉伯语。像阿拉伯语处理中的许多其他任务或问题一样,投入该问题的薄弱努力以及缺乏可用(开源)资源阻碍了对该问题解决的进展。本工作对当前现有的阿拉伯语文本标音系统、度量和资源进行了批判性回顾。此外,它引入了一个急需的、人人可免费使用的清洗数据集,可轻松用于基准测试任何阿拉伯语标音工作。该数据集提取自 Tashkeela 语料库,由 55K 行组成,包含约 2.3M 个词。在构建数据集后,现有工具和系统在其上进行了测试。实验结果表明,神经 Shakkala 系统显著优于传统的基于规则的方法和其他闭源工具,其标音错误率(DER)为 2.88%,而最佳非神经方法(由 Mishkal 工具获得)的 DER 为 13.78%。
引用
@article{arxiv.1905.01965,
title = {Arabic Text Diacritization Using Deep Neural Networks},
author = {Ali Fadel and Ibraheem Tuffaha and Bara' Al-Jawarneh and Mahmoud Al-Ayyoub},
journal= {arXiv preprint arXiv:1905.01965},
year = {2019}
}
备注
7 pages, 4 figures, 15 tables