Sketch2Feedback:面向学生 STEM 图表的 Rubric 对齐反馈的语法回环框架
计算机视觉与模式识别
2026-02-24 v1 人工智能
摘要
为学生绘制的图表提供及时且符合评分标准的反馈是 STEM 教育中的持久挑战。虽然大型多模态模型(LMM)可以联合解析图像并生成解释,但其倾向于产生幻觉,削弱了在课堂部署中的可信度。我们提出 Sketch2Feedback,一种语法回环框架,将问题分解为四个阶段——混合感知、符号图构建、约束检查和受限 VLM 反馈——使得语言模型仅在上游规则引擎验证违规后才进行言语化。我们在两个合成微基准测试上进行评估:FBD-10(自由身图)和 Circuit-10(电路原理图),每个基准包含 500 张图像,涵盖标准和硬噪声增强等级,比较我们的管道与端到端 LMM(LLaVA-1.5-7B、Qwen2-VL-7B)、视觉唯一检测器、YOLOv8-nano 学习检测器和集体 oracle。在每个基准测试中各 100 个测试样本上进行评估(95% bootstrap 置信区间),结果呈现出混合且具有启发性的发现:Qwen2-VL-7B 在 FBD 和电路上分别取得最高的微 F1 分数(0.570 和 0.528),但伴随极端幻觉率(0.78 和 0.98)。一个集体 oracle 能在 FBD 上实现 F1=0.556,幻觉率为 0.320,表明语法方法与端到端方法之间存在可被利用的互补性。在 tau=0.7 的置信度阈值下,电路幻觉率从 0.970 降至 0.880,F1 分数无损失。硬噪声增强揭示了领域依赖的鲁棒性:FBD 检测具有鲁棒性,而电路检测则显著退化。LLM 作为评判器的评估确认,语法管道在电路反馈可操作性上(4.85/5)优于端到端 LMM(3.11/5)。我们发布所有代码、数据集和评估脚本。
引用
@article{arxiv.2602.18520,
title = {Sketch2Feedback: Grammar-in-the-Loop Framework for Rubric-Aligned Feedback on Student STEM Diagrams},
author = {Aayam Bansal},
journal= {arXiv preprint arXiv:2602.18520},
year = {2026}
}