深度标音:用于改进阿拉伯语标音的高效分层递归结构
计算与语言
2020-11-03 v1 机器学习
摘要
我们提出了一种用于字符序列标注的新颖架构,在 Tashkeela 阿拉伯语标音基准上取得了最先进的结果。其核心是一个分别在词和字符级别上运作的两级递归层次——与可比较的传统模型相比,实现了更快的训练和推理。一个跨级注意力模块进一步连接两者,并为网络可解释性打开了大门。任务模块是一个 softmax 分类器,枚举标音的有效组合。该架构可通过递归解码器扩展,该解码器可选地接受来自部分标音文本的先验,从而改进结果。我们采用句子丢弃和多数投票等额外技巧来进一步提升最终结果。我们的最佳模型实现了 5.34% 的 WER,以 30.56% 的相对错误率降低优于先前的最先进水平。
引用
@article{arxiv.2011.00538,
title = {Deep Diacritization: Efficient Hierarchical Recurrence for Improved Arabic Diacritization},
author = {Badr AlKhamissi and Muhammad N. ElNokrashy and Mohamed Gabr},
journal= {arXiv preprint arXiv:2011.00538},
year = {2020}
}
备注
This work was accepted at the Fifth Arabic Natural Language Processing Workshop (COLING/WANLP 2020)