面向 L2 写作评估的自指性分析评估:基于轮廓的 LLM 方法
计算与语言
2026-05-07 v1
摘要
自动作文评分 (AES) 研究常依赖基于排名的相关性指标进行验证。然而,这类指标掩盖了写作技能本身结构引发的维度间内在关联,以及明显效应 (halo effect),即整体印象滲透至细粒度组件评分。结果是,高相关性可能掩盖系统的真实诊断行为。本研究提出一种新颖的自指性评估框架,聚焦识别学习者内在优势与短板,而非评估学习者间排名。我们在公开的 ICNALE GRA 数据集上进行实验,该数据集由最高 80 名经过训练的评分员对作品进行整体与分析双重标注。为获得可靠参考分数,我们采用两因素 Rasch 模型校准评分员严重程度,并推导出十个分析维度及整体熟练程度的公平平均分数。我们比较了人工操作评分员与三种大语言模型 (LLM) 在零-shot 设置下的分析评分性能。结果表明,LLM 在识别多个熟练程度维度下的相对短板 (负向反馈) 方面优于单位人工评分员,而人工评分员在识别相对优势 (正向反馈) 方面仍具优势。总体而言,我们的发现凸显基于排名的评估方法在分析评估中的局限性,并展示了基于学习者内在、轮廓方法在 AES 中评估与部署 LLM 的价值。
引用
@article{arxiv.2605.04298,
title = {Towards Self-Referential Analytic Assessment: A Profile-Based Approach to L2 Writing Evaluation with LLMs},
author = {Stefano Bannò and Kate Knill and Mark Gales},
journal= {arXiv preprint arXiv:2605.04298},
year = {2026}
}
备注
Accepted for the 21st Workshop on Innovative Use of NLP for Building Educational Applications