利用合成数据和错误注入提升阿拉伯语自动作文评分
计算与语言
2025-06-11 v2
摘要
自动作文评分 (AES) 在评估语言学习者写作质量、减轻评分负担并提供实时反馈方面发挥着关键作用。缺乏带注释的作文数据集限制了阿拉伯语 AES 系统的发展。本文利用大语言模型 (LLM) 和 Transformer 模型生成阿拉伯语合成作文用于 AES。我们引导 LLM 在欧洲语言框架 (CEFR) 水平之间生成作文,并介绍并比较两种错误注入方法。我们创建了一个包含 3040 篇带错误注释的作文数据集。此外,我们开发了一个基于 BERT 的阿拉伯语 AES 系统,已校准为 CEFR 水平。我们的实验结果表明,合成数据在提升阿拉伯语 AES 性能方面效果显著。我们将代码和数据公开于可获取平台。
引用
@article{arxiv.2503.17739,
title = {Enhancing Arabic Automated Essay Scoring with Synthetic Data and Error Injection},
author = {Chatrine Qwaider and Bashar Alhafni and Kirill Chirkunov and Nizar Habash and Ted Briscoe},
journal= {arXiv preprint arXiv:2503.17739},
year = {2025}
}