中文

NERIF:基于GPT-4V的绘图模型自动评分方法

人工智能 2023-12-29 v2

摘要

对学生绘制的模型进行评分十分耗时。近期发布的GPT-4V凭借强大的图像处理能力,为推进科学建模实践提供了独特机遇。为专门测试其自动评分能力,我们开发了一种名为NERIF(Notation-Enhanced Rubric Instruction for Few-shot Learning,少样本学习中的符号增强量规指令)的方法,利用指令说明与评分量规提示GPT-4V对学生在科学现象方面的绘图模型进行评分。我们随机选取了一组平衡数据(N = 900),包含针对六项建模评估任务的学生绘图模型。依据评分量规,每个模型由GPT-4V给出三级评分:“Beginning(初级)”、“Developing(发展中)”或“Proficient(熟练)”。将GPT-4V的评分与人类专家的评分进行比较以计算评分准确率。结果显示,GPT-4V的平均评分准确率为均值 = .51,标准差 = .037。具体而言,“Beginning”类的平均准确率为 .64,“Developing”类为 .62,“Proficient”类为 .26,表明越熟练的模型越难评分。进一步的定性研究揭示了GPT-4V如何从图像输入中提取信息,包括问题语境、人类编码者提供的示例评估以及学生的绘图模型。我们也揭示了GPT-4V如何捕捉学生绘图模型的特征并用自然语言加以叙述。最后,我们展示了GPT-4V如何依据给定的评分量规与指令说明为学生绘图模型赋分。我们的研究结果表明,NERIF是一种利用GPT-4V进行绘图模型评分的有效方法。尽管GPT-4V在评分准确率上仍有提升空间,部分误评分数对专家而言似乎是可解释的。本研究结果显示,利用GPT-4V对学生绘图模型进行自动评分具有广阔前景。

关键词

引用

@article{arxiv.2311.12990,
  title  = {NERIF: GPT-4V for Automatic Scoring of Drawn Models},
  author = {Gyeong-Geon Lee and Xiaoming Zhai},
  journal= {arXiv preprint arXiv:2311.12990},
  year   = {2023}
}