揭示评分过程:剖析LLM与人类评分员在自动评分中的差异
计算与语言
2025-02-24 v2 计算机与社会
摘要
大型语言模型(LLM)已在执行构件响应评估的自动评分方面显示出强大的潜力。虽然由人类评分员对构件响应进行的评分通常基于给定的评分标准,但LLM如何分配分数的方法仍鲜为人知。也不确定人工智能的评分过程是否与人类评分过程相吻合,或是否遵循相同的评分标准。为弥合这一差距,本文揭示了LLM用于对学生科学任务书面响应进行评分的评分标准,并研究其与人类分数之间的对齐情况。我们还检查了增强对齐程度是否可以提高评分准确性。具体而言,我们提示LLM生成用于分配分数的分析性评分标准,并研究其与人类评分标准之间的对齐差距。基于多种配置的LLM设置进行的一系列实验揭示了人类与LLM评分员之间显著的对齐差距。尽管LLM能够快速适应评分任务,但它们往往依赖捷径,绕过人类评分中预期的深层逻辑推理。我们发现,纳入旨在反映人类评分逻辑的高质量分析性评分标准可以缩小这一差距并提高LLM的评分准确性。这些结果凸显了在科学教育中应用LLM的细致方法的必要性,并强调了将LLM输出与人类期望相吻合以确保高效和准确的自动评分的重要性。
引用
@article{arxiv.2407.18328,
title = {Unveiling Scoring Processes: Dissecting the Differences between LLMs and Human Graders in Automatic Scoring},
author = {Xuansheng Wu and Padmaja Pravin Saraf and Gyeonggeon Lee and Ehsan Latif and Ninghao Liu and Xiaoming Zhai},
journal= {arXiv preprint arXiv:2407.18328},
year = {2025}
}
备注
Accepted by Technology, Knowledge, and Learning (TKNL)