TiViBench:视频生成模型视频内推理能力基准测试
计算机视觉与模式识别
2025-12-23 v2
摘要
视频生成模型的快速发展已将其焦点从生成视觉上合理的输出转移到处理需要物理合理性和逻辑一致性的任务。然而,尽管最近取得了如Veo 3的帧链推理等突破,这些模型是否能展现出类似于大语言模型(LLM)的推理能力仍不清楚。现有基准主要评估视觉保真度和时间一致性,未能捕捉到高阶推理能力。为了弥补这一差距,我们提出了TiViBench,这是一个专门设计用于评估图像到视频(I2V)生成模型推理能力的分层基准。TiViBench系统性地评估了四个维度的推理能力:i) 结构推理与搜索,ii) 空间与视觉模式推理,iii) 符号与逻辑推理,以及iv) 动作规划与任务执行,涵盖3个难度级别的24个多样化任务场景。通过广泛的评估,我们表明商业模型(例如,Sora 2, Veo 3.1)展现出更强的推理潜力,而开源模型则揭示了尚未开发的潜力,这些潜力仍受到有限训练规模和数据多样性的阻碍。为了进一步释放这一潜力,我们引入了VideoTPO,这是一种受偏好优化启发的简单而有效的测试时策略。通过对生成的候选视频进行LLM自我分析以识别优势和劣势,VideoTPO显著增强了推理性能,而无需额外的训练、数据或奖励模型。TiViBench和VideoTPO共同为评估和推进视频生成模型的推理能力铺平了道路,为这一新兴领域的未来研究奠定了基础。
引用
@article{arxiv.2511.13704,
title = {TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models},
author = {Harold Haodong Chen and Disen Lan and Wen-Jie Shu and Qingyang Liu and Zihan Wang and Sirui Chen and Wenkai Cheng and Kanghao Chen and Hongfei Zhang and Zixin Zhang and Rongjin Guo and Yu Cheng and Ying-Cong Chen},
journal= {arXiv preprint arXiv:2511.13704},
year = {2025}
}
备注
Project: https://haroldchen19.github.io/TiViBench-Page/