中文

深度标音:用于改进阿拉伯语标音的高效分层递归结构

计算与语言 2020-11-03 v1 机器学习

摘要

我们提出了一种用于字符序列标注的新颖架构,在 Tashkeela 阿拉伯语标音基准上取得了最先进的结果。其核心是一个分别在词和字符级别上运作的两级递归层次——与可比较的传统模型相比,实现了更快的训练和推理。一个跨级注意力模块进一步连接两者,并为网络可解释性打开了大门。任务模块是一个 softmax 分类器,枚举标音的有效组合。该架构可通过递归解码器扩展,该解码器可选地接受来自部分标音文本的先验,从而改进结果。我们采用句子丢弃和多数投票等额外技巧来进一步提升最终结果。我们的最佳模型实现了 5.34% 的 WER,以 30.56% 的相对错误率降低优于先前的最先进水平。

关键词

引用

@article{arxiv.2011.00538,
  title  = {Deep Diacritization: Efficient Hierarchical Recurrence for Improved Arabic Diacritization},
  author = {Badr AlKhamissi and Muhammad N. ElNokrashy and Mohamed Gabr},
  journal= {arXiv preprint arXiv:2011.00538},
  year   = {2020}
}

备注

This work was accepted at the Fifth Arabic Natural Language Processing Workshop (COLING/WANLP 2020)