中文

LLM 在多维度分析性写作评估中的表现:L2 研究生学术英语写作案例研究

计算与语言 2025-06-03 v2 人工智能

摘要

本文探讨了大型语言模型 (LLM) 在多维度分析性写作评估中的表现,即其能够基于多个评估标准提供分数和评论的能力。我们使用由 L2 研究生学生撰写的文献综述语料库,该语料库由人类专家针对 9 个分析性准则进行评估。我们让几个流行的 LLM 在各种条件下完成相同的任务。为了评估反馈评论的质量,我们应用了一种新颖的反馈评论质量评估框架。该框架可解释、成本效益高、可扩展且可复现,与依赖手动判断的现有方法相比更为优势。我们发现 LLM 能够生成相当不错且通常可靠的多维度分析性评估。我们公开了语料库和代码以实现可复现性。

关键词

引用

@article{arxiv.2502.11368,
  title  = {LLMs can Perform Multi-Dimensional Analytic Writing Assessments: A Case Study of L2 Graduate-Level Academic English Writing},
  author = {Zhengxiang Wang and Veronika Makarova and Zhi Li and Jordan Kodner and Owen Rambow},
  journal= {arXiv preprint arXiv:2502.11368},
  year   = {2025}
}

备注

ACL 2025