学习视频时间流动:快速与缓慢
计算机视觉与模式识别
2026-04-24 v1 人工智能
图形学
摘要
我们如何判断视频是被加速还是减速?我们如何生成不同速度的视频?尽管视频是现代计算机视觉研究的核心,但人们很少关注感知和控制时间的流逝。本文将时间作为可学习的视觉概念,发展出模型以推理和操控视频中时间的流动。我们首先利用视频中天然存在的多模态线索和时序结构,以自监督方式学习检测速度变化并估计播放速度。随后我们表明,这些所学的时序推理模型使我们能够精选最大规模的慢动作视频数据集,源自噪声野生数据。此类慢动作 footage——通常由高速摄像机拍摄——包含远超常规视频的丰富时序细节。利用此数据,我们进一步发展出能够进行时序控制的模型,包括速度条件视频生成(产生指定播放速度的运动),以及时序超分辨(将低 FPS、模糊视频转换为高 FPS 序列以获得细粒度时序细节)。我们的发现突显了时间作为可操控的感知维度在视频学习中的作用,开启了时序可控视频生成、时序 Forensic 检测,以及可能更丰富理解事件随时间推移方式的世界模型之门。
引用
@article{arxiv.2604.21931,
title = {Seeing Fast and Slow: Learning the Flow of Time in Videos},
author = {Yen-Siang Wu and Rundong Luo and Jingsen Zhu and Tao Tu and Ali Farhadi and Matthew Wallingford and Yu-Chiang Frank Wang and Steve Marschner and Wei-Chiu Ma},
journal= {arXiv preprint arXiv:2604.21931},
year = {2026}
}
备注
Project page: https://seeing-fast-and-slow.github.io/