EduVQA:面向教育AI生成视频的概念感知评估
计算机视觉与模式识别
2026-05-20 v3
摘要
现有的AI生成视频质量评估(AIGVQA)方法主要关注全局感知真实性和粗糙的文本-视频对齐,忽视了教育场景中的一个关键要求:概念正确性。在早期数学教育中,数值、几何关系或空间配置中的细微错误可能会在视觉上看起来合理的情况下彻底改变传达的知识。为解决此问题,我们引入EduAVQABench,即第一个面向概念感知教育AIGV评估的基准数据集,包含 1,130 个由十个最先进T2V模型生成的视频,以及超过 310,650 项细粒度的人类注释,涵盖感知质量和语义对齐。基于此基准,我们进一步提出EduVQA,一个具备结构化二维混合专家(S2D-MoE)架构的概念感知AIGVQA框架。通过共享专家和自适应二维路由,EduVQA 在细粒度概念评估和整体质量预测之间进行联合建模,有效捕捉传统全局评分方法所忽视的细粒度概念不一致性。大量实验表明,EduVQA 在感知和语义评估任务中均显著优于现有AIGVQA方法,并在未见基准上表现出强大的泛化能力。代码和数据集将公开于:https://github.com/EduVQA/EduVQA。
引用
@article{arxiv.2603.03066,
title = {EduVQA: Towards Concept-Aware Assessment of Educational AI-Generated Videos},
author = {Baoliang Chen and Xinlong Bu and Hanwei Zhu and Lingyu Zhu and Jieyu Zhan},
journal= {arXiv preprint arXiv:2603.03066},
year = {2026}
}