中文

CycliST:面向循环状态转换推理的视频语言模型基准

计算机视觉与模式识别 2025-12-02 v1 人工智能 机器学习

摘要

我们提出 CycliST,这是一个新颖的基准数据集,旨在评估视频语言模型(VLM)在循环状态转换文本推理方面的能力。CycliST 通过生成包含物体运动和视觉属性周期性模式的合成、结构丰富的视频序列,捕捉真实世界过程的基本方面。CycliST 采用分层评估系统,通过物体数量、场景杂乱程度和照明条件的变化,逐步提升难度,挑战当前领先的模型在时空认知方面的表现。我们对当前领先的 VLM(包括开源和商业模型)进行了大规模实验,揭示了其在推广到循环动力学(如线性和轨道运动)以及视觉属性(如颜色和尺度)随时间变化时存在的局限性。我们的结果表明,当今的 VLM 在可靠检测和利用循环模式方面困难,缺乏时序理解概念,无法从场景中提取定量信息(如运动物体的数量),这凸显了一个需要被解决的显著技术差距。更具体地说,我们发现没有单个模型在性能上始终领先:模型规模和架构都与结果关联性不强,且没有模型在所有任务中都表现出色。通过提供针对性挑战和全面的评估框架,CycliST 为超越当前技术水平、理解周期模式的视觉推理模型铺平了道路。

关键词

引用

@article{arxiv.2512.01095,
  title  = {CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions},
  author = {Simon Kohaut and Daniel Ochs and Shun Zhang and Benedict Flade and Julian Eggert and Kristian Kersting and Devendra Singh Dhami},
  journal= {arXiv preprint arXiv:2512.01095},
  year   = {2025}
}