中文

LCES:基于成对比较的零样本自动作文评分方法

计算与语言 2025-09-23 v2 人工智能

摘要

最近的大语言模型(LLM)的进展使得零样本自动作文评分(AES)成为可能,这为减少与手动评分相对于的成本和工作量提供了前景。然而,大多数现有的零样本方法依赖LLM直接生成绝对分数,由于模型偏见和不一致的评分,这些分数往往与人类评估存在偏差。为解决这些限制,我们提出了基于LLM的比较作文评分(LCES)方法,将AES问题形式化为成对比较任务。具体而言,我们指示LLM判断两个作文中哪一个更好,收集大量此类比较结果,并将其转换为连续分数。鉴于可能的比较数量随作文数量的二次增长,我们通过采用RankNet来高效地将LLM偏好转换为标量分数,以提高可扩展性。使用AES基准数据集的实验表明,LCES在准确率上优于传统零样本方法,同时保持计算效率。此外,LCES在不同的LLM Backbone之间都表现出色,凸显了其在实际零样本AES中的适用性。

关键词

引用

@article{arxiv.2505.08498,
  title  = {LCES: Zero-shot Automated Essay Scoring via Pairwise Comparisons Using Large Language Models},
  author = {Takumi Shibata and Yuichi Miyamura},
  journal= {arXiv preprint arXiv:2505.08498},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Main Conference)