ConfusionBench:面向教育视频的经专家验证的混淆识别与定位基准
计算机视觉与模式识别
2026-03-19 v1
摘要
从视频中识别和定位学生的混淆是教育人工智能中的一个重要但具有挑战性的问题。现有混淆数据集存在标签噪声、粗糙的时间标注和有限的专家验证,限制了可靠的细粒度识别和时空定位分析。为解决这些限制,我们提出了一个实用的多阶段过滤管道,集成了两阶段模型辅助筛选、研究人员审核和专家验证,以构建更高质量的混淆理解基准。基于此管道,我们引入了 ConfusionBench,一个新的教育视频基准,包含平衡的混淆识别数据集和视频定位数据集。我们进一步提供了代表性开源模型和专有模型在剪辑级混淆识别和长视频混淆定位任务上的零样本基线评估。实验结果表明,专有模型总体性能更好,但倾向于过度预测过渡段落,而开源模型更保守,容易产生漏检。在此基础上,我们提出的学生混淆报告可视化可支持教育专家做出干预决策并调整学习计划。所有数据集和相关材料将在项目页面上公开。
引用
@article{arxiv.2603.17267,
title = {ConfusionBench: An Expert-Validated Benchmark for Confusion Recognition and Localization in Educational Videos},
author = {Lu Dong and Xiao Wang and Mark Frank and Srirangaraj Setlur and Venu Govindaraju and Ifeoma Nwogu},
journal= {arXiv preprint arXiv:2603.17267},
year = {2026}
}