面向阿拉伯语的自动错误类型标注
计算与语言
2021-09-17 v1
摘要
我们提出 ARETA,一个面向现代标准阿拉伯语的自动错误类型标注系统。我们设计 ARETA 以应对阿拉伯语的形态丰富性与正字法歧义。我们的错误分类体系基于阿拉伯语学习者语料库(ALC)错误标注集并做了一些修改。ARETA 在 ALC 的人工标注盲测部分上取得了 85.8%(微平均 F1 分数)的性能。我们还通过将 ARETA 应用于 QALB 2014 阿拉伯语语法错误纠正共享任务的若干提交来展示其实用性。所得分析对不同提交的优势与不足提供了有益见解,这比共享任务中使用的不透明 M2 评分指标更有用。ARETA 采用了一个大型阿拉伯语形态分析器,除此之外完全无监督。我们将 ARETA 公开可用。
引用
@article{arxiv.2109.08068,
title = {Automatic Error Type Annotation for Arabic},
author = {Riadh Belkebir and Nizar Habash},
journal= {arXiv preprint arXiv:2109.08068},
year = {2021}
}