基于反思-修订的自动化细化论文评分标准
计算与语言
2025-10-13 v1
摘要
大型语言模型(LLM)的性能高度依赖其所使用的提示。drawing inspiration from the field of prompt optimization, 本研究探讨了通过细化 LLM 用于自动化论文评分(AES)的评分标准以提升 AES 性能的潜力。具体而言,我们的方法通过反思模型自身的评分理由以及与人类分数在样本论文上的差异,来迭代细化评分标准。实验在 TOEFL11 和 ASAP 数据集上进行,使用 GPT-4.1、Gemini-2.5-Pro 和 Qwen-3-Next-80B-A3B-Instruct。结果显示,二次加权Kappa(QWK)提升最高可达0.19和0.47。值得注意的是,即使采用简单的初始评分标准,我们的方法也能实现与使用详细人类编写评分标准相当或更好的 QWK。我们的发现凸显了在 LLM 基于 AES 中实现与人类评估对齐的重要性,以及迭代评分标准细化的作用。
引用
@article{arxiv.2510.09030,
title = {Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise},
author = {Keno Harada and Lui Yoshida and Takeshi Kojima and Yusuke Iwasawa and Yutaka Matsuo},
journal= {arXiv preprint arXiv:2510.09030},
year = {2025}
}