评估GPT-4在数学考试手写答案评分中的表现
计算机与社会
2024-12-13 v2 计算与语言
机器学习
摘要
生成式人工智能(AI)的最新进展在准确评分开放式学生回答方面展现出前景。然而,由于缺乏数据以及结合视觉和文本信息的挑战,此前很少有工作探索手写答案的评分。在本工作中,我们利用最先进的模态AI模型,特别是GPT-4o,自动评分大学水平的数学考试手写答案。使用概率论考试中学生回答的真实问题,我们使用各种提示技术(prompting techniques)评估GPT-4o与人类评分者给出的真实分数(ground-truth scores)的一致性。我们发现,虽然提供评分标准(rubrics)可以改善一致性,但模型的整体准确率仍然过低,不适合实际应用场景,表明该任务仍有显著的成长空间。
引用
@article{arxiv.2411.05231,
title = {Evaluating GPT-4 at Grading Handwritten Solutions in Math Exams},
author = {Adriana Caraeni and Alexander Scarlatos and Andrew Lan},
journal= {arXiv preprint arXiv:2411.05231},
year = {2024}
}
备注
Published in LAK 2025: The 15th International Learning Analytics and Knowledge Conference