RULER-Bench:探索下一代视频生成模型基于规则的推理能力
计算机视觉与模式识别
2025-12-25 v1
摘要
近期视频生成技术的进展,使视频合成能够实现强大的时序一致性和卓越的视觉质量,标志着迈向视觉基础模型的关键一步。为了评估这些视频生成模型,现有基准主要关注与视觉感知和理解相关的因素,如视觉美学、指令遵循和时序一致性。然而,视频生成模型的基于规则的推理能力仍基本未被探索。尽管近期研究尝试探索视频模型是否可作为零样本学习器,但仍缺乏对推理能力的细粒度分解和全面评估协议。为填补这一差距,我们引入RULER-Bench,一个从认知规则视角评估视频生成模型推理能力的基准。基于文本到视频和图像到视频两个基本范式,RULER-Bench涵盖40个典型任务,分为六个规则类别,包含622个高质量标注实例。对于每个生成视频的评估,我们构建检查清单,涵盖四项指标,并利用GPT-o3为每个问题赋分,实现与人类判断的85%一致性。大量实验表明,最先进的模型在规则连贯性指标上仅得48.87%,凸显了下一代视频模型推理能力仍有显著提升空间。我们期望RULER-Bench所获取的洞见将促进基于推理的视频生成发展,推动视频生成模型迈向视觉基础智能。
引用
@article{arxiv.2512.02622,
title = {RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence},
author = {Xuming He and Zehao Fan and Hengjia Li and Fan Zhuo and Hankun Xu and Senlin Cheng and Di Weng and Haifeng Liu and Can Ye and Boxi Wu},
journal= {arXiv preprint arXiv:2512.02622},
year = {2025}
}