用于细粒度阿拉伯语可读性评估的大规模平衡语料库
计算与语言
2025-06-17 v2
摘要
本文介绍了平衡阿拉伯语可读性评估语料库(BAREC),这是一个用于阿拉伯语可读性评估的大规模、细粒度数据集。BAREC包含跨越100多万词的69,441个句子,经过精心策划覆盖了从幼儿园到研究生理解水平的19个可读性等级。该语料库平衡了体裁多样性、主题覆盖面和目标受众,为评估阿拉伯语文本复杂性提供了综合资源。该语料库完全由一个大型标注团队进行人工标注。以二次加权Kappa测量的平均成对标注者间一致性为81.8%,反映出高水平的实质性一致。除了展示该语料库外,我们还在不同粒度级别上对自动可读性评估进行了基准测试,比较了一系列技术。我们的结果突出了阿拉伯语可读性建模中的挑战与机遇,展示了各种方法的竞争性能。为了支持研究与教育,我们公开提供BAREC,以及详细的标注指南和基准测试结果。
引用
@article{arxiv.2502.13520,
title = {A Large and Balanced Corpus for Fine-grained Arabic Readability Assessment},
author = {Khalid N. Elmadani and Nizar Habash and Hanada Taha-Thomure},
journal= {arXiv preprint arXiv:2502.13520},
year = {2025}
}
备注
Accepted at ACL 2025 Findings