评估面向印度尼西亚课堂的视觉语言与大语言模型用于自动学生评估
计算与语言
2026-04-02 v3
摘要
尽管视觉语言模型 (VLM) 和大语言模型 (LLM) 在近年取得了显著进展,但其在现实世界、少数民族教室中用于 AI 驱动教育评估的效果仍鲜有探讨。我们在印度尼西亚对 14 千余份小学四年级学生的手写答案上,对最先进的 VLM 和 LLM 进行评估,涵盖数学和英语,两者均符合当地国家课程标准。不同于以往针对干净数字文本的工作,我们的数据集包含来自真实课堂的自然弯曲、多样化的手写体,具有真实的视觉与语言挑战。评估任务包括依据评分标准进行批改和生成个性化的印度尼西亚语反馈。结果表明,VLM 在手写体识别方面表现不佳,导致 LLM 批改时出现误差传播,但尽管视觉输入不完美,LLM 生成的反馈仍在教育意义上有用,这揭示了个性化和情境相关性的局限性。
引用
@article{arxiv.2506.04822,
title = {Evaluating Vision-Language and Large Language Models for Automated Student Assessment in Indonesian Classrooms},
author = {Nurul Aisyah and Muhammad Dehan Al Kautsar and Arif Hidayat and Raqib Chowdhury and Fajri Koto},
journal= {arXiv preprint arXiv:2506.04822},
year = {2026}
}
备注
Accepted at AIED 2026