PhyEduVideo:用于评估物理教育文本到视频模型的基准
计算机视觉与模式识别
2026-01-06 v1
摘要
生成式 AI 模型,特别是文本到视频 (T2V) 系统,为通过自动创建引人注目且直观的视觉解释来变革科学教育提供了可行的途径。本文致力于评估其在物理教育中的潜力,引入了专门用于解释性视频生成的基准测试。该基准设计用于评估 T2V 模型通过视觉图解传达核心物理概念的能力。基准中的每个物理概念都被分解为细粒度的教学点,每个教学点都配有一个精心设计的提示,用于视觉解释教学点。T2V 模型被评估其生成准确视频以响应这些提示的能力。我们的目标是系统性地探讨使用 T2V 模型生成高质量、与课程一致的教育内容的可行性——为实现由 AI 驱动的可扩展、可及且个性化的学习体验铺平道路。我们的评估显示,当前模型产生视觉连贯、运动平滑且 Flickering 最小的视频,但其概念准确性较不可靠。在机械、流体和光学领域的表现令人鼓舞,但模型在电磁学和热力学方面困难,后者涉及更抽象的相互作用。这些发现凸显了教育视频生成中视觉质量与概念正确性之间的差距。我们希望这个基准能帮助社区缩小这一差距,朝向能够按比例交付准确、与课程一致的物理内容的 T2V 系统发展。该基准及其附带代码已公开于 https://github.com/meghamariamkm/PhyEduVideo。
引用
@article{arxiv.2601.00943,
title = {PhyEduVideo: A Benchmark for Evaluating Text-to-Video Models for Physics Education},
author = {Megha Mariam K. M and Aditya Arun and Zakaria Laskar and C. V. Jawahar},
journal= {arXiv preprint arXiv:2601.00943},
year = {2026}
}
备注
Accepted at IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026