秩序-得分:增强自动化作文评分中大型语言模型的框架
计算与语言
2025-04-09 v1 人工智能
摘要
近年来,大型语言模型(LLM)在各类任务中取得了显著的成功。然而,它们在自动化作文评分(Automated Essay Scoring, AES)领域的潜力仍未得到充分挖掘。此外,与英文数据相比,中文作文评分的方法尚不成熟。本文提出了一种基于大型语言模型的微调框架——秩序-得分(Rank-Then-Score, RTS),以提升其作文评分能力。具体而言,我们使用特征丰富的数据对排序模型(Ranker)进行微调,然后将排序模型的输出(以候选得分集合形式)输入评分模型(Scorer),最终生成得分。实验在两个基准数据集上进行,HSK 和 ASAP 数据集,结果表明RTS在所有大型语言模型和数据集上的平均四分位相关系数(QWK)均优于直接提示(Vanilla)方法,并在使用HSK数据集进行中文作文评分时取得最佳性能。
引用
@article{arxiv.2504.05736,
title = {Rank-Then-Score: Enhancing Large Language Models for Automated Essay Scoring},
author = {Yida Cai and Kun Liang and Sanwoo Lee and Qinghan Wang and Yunfang Wu},
journal= {arXiv preprint arXiv:2504.05736},
year = {2025}
}
备注
17 pages