CycliST:面向循环状态转换推理的视频语言模型基准
计算机视觉与模式识别
2025-12-02 v1 人工智能
机器学习
摘要
我们提出 CycliST,这是一个新颖的基准数据集,旨在评估视频语言模型(VLM)在循环状态转换文本推理方面的能力。CycliST 通过生成包含物体运动和视觉属性周期性模式的合成、结构丰富的视频序列,捕捉真实世界过程的基本方面。CycliST 采用分层评估系统,通过物体数量、场景杂乱程度和照明条件的变化,逐步提升难度,挑战当前领先的模型在时空认知方面的表现。我们对当前领先的 VLM(包括开源和商业模型)进行了大规模实验,揭示了其在推广到循环动力学(如线性和轨道运动)以及视觉属性(如颜色和尺度)随时间变化时存在的局限性。我们的结果表明,当今的 VLM 在可靠检测和利用循环模式方面困难,缺乏时序理解概念,无法从场景中提取定量信息(如运动物体的数量),这凸显了一个需要被解决的显著技术差距。更具体地说,我们发现没有单个模型在性能上始终领先:模型规模和架构都与结果关联性不强,且没有模型在所有任务中都表现出色。通过提供针对性挑战和全面的评估框架,CycliST 为超越当前技术水平、理解周期模式的视觉推理模型铺平了道路。
引用
@article{arxiv.2512.01095,
title = {CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions},
author = {Simon Kohaut and Daniel Ochs and Shun Zhang and Benedict Flade and Julian Eggert and Kristian Kersting and Devendra Singh Dhami},
journal= {arXiv preprint arXiv:2512.01095},
year = {2025}
}