利用特征丰富的 biLSTM 模型进行阿拉伯语变音符号恢复
计算与语言
2020-02-05 v1 机器学习
摘要
变音符号(短元音)在书写阿拉伯语文本时通常被省略,读者必须重新引入它们以正确发音单词。阿拉伯语变音符号有两种类型:第一种是核心词变音(CW),指定词汇选择;第二种是格尾(CE),通常出现在词干末尾并一般指定其句法角色。由于经常是远距离的词间依赖关系,恢复 CE 比恢复核心词变音相对更难。在本文中,我们使用一个特征丰富的循环神经网络模型,该模型利用多种语言学和表层特征来恢复核心词变音和格尾。我们的模型超越了所有先前的 SOTA 系统:现代标准阿拉伯语(MSA)的 CW 错误率(CWER)为 2.86%、CE 错误率(CEER)为 3.7%,古典阿拉伯语(CA)的 CWER 为 2.2%、CEER 为 2.5%。当将变音化的词核心与格尾结合时,MSA 和 CA 的相应词错误率分别为 6.0% 和 4.3%。这凸显了此类深度神经模型中特征工程的有效性。
引用
@article{arxiv.2002.01207,
title = {Arabic Diacritic Recovery Using a Feature-Rich biLSTM Model},
author = {Kareem Darwish and Ahmed Abdelali and Hamdy Mubarak and Mohamed Eldesouki},
journal= {arXiv preprint arXiv:2002.01207},
year = {2020}
}