中文

结构胜于规模:从教学视频中学习视觉推理

计算机视觉与模式识别 2026-05-11 v2

摘要

最先进的视觉语言模型(VLM)在视频基准测试中得分令人印象深刻,但在涉及空间关系、导航和物体选择等基本视觉推理任务上却步履蹒跚,而这些任务学龄前儿童都能轻松解决。我们假设,明确的教学结构,特别是嵌入在儿童教育视频中的上下文-问题-暂停-回答循环,提供了自然对齐的推理轨迹:时间同步的视觉线索、问题和答案,这些仅源于精心设计的教学创作,无法通过大规模手动注释实际重建。为了验证这一点,我们引入了SoSVQA(结构胜于规模视觉问答),这是一个统一的基准测试,包含从《爱探险的朵拉》(DoraVQA)和《米奇妙妙屋》(ClubHVQA)中自动提取的10K个问答对,并具有精确的时间戳对齐,并使用组相对策略优化(GRPO)微调Qwen2-VL和Qwen3-VL,以利用教育内容中固有的清晰正确性信号和结构化推理轨迹。尽管仅使用来自78小时儿童电视节目的10K个问答对进行训练,数据量比GPT和Gemini少几个数量级,我们的方法为基于Qwen的VLM带来了可泛化的性能提升,在NExT-QA (+19.7)、Video-MME (+10.6)和MotionBench (+4.9)上取得了一致的改进,与领先的专有系统性能相匹配,并证明了内容结构可以弥补内容规模的不足。

关键词

引用

@article{arxiv.2601.23251,
  title  = {Structure Over Scale: Learning Visual Reasoning from Pedagogical Video},
  author = {Bishoy Galoaa and Xiangyu Bai and Sarah Ostadabbas},
  journal= {arXiv preprint arXiv:2601.23251},
  year   = {2026}
}