TIME Machine:利用运动实现高效感知的力量
计算机视觉与模式识别
2026-05-25 v1 人工智能
机器学习
摘要
视频表示学习在近年来取得了显著进展。这得益于许多因素,包括训练规模的增加以及基于对比学习的视觉模型在语言中的成功。尽管这些因素推动了视频模型的能力边界,但也带来了自身的局限性:首先,规模化视频模型可能面临巨大的成本;其次,仅能从语言中学习限制了可学习概念的范围。结果是,视频模型在时序理解方面仍然受限。本文提出了一种新方法,将运动作为视频表示的核心模态。具体而言,给定以点轨迹形式表示的视频运动,我们使用掩码化自编码器对部分轨迹进行掩码处理,然后训练自编码器重建缺失的轨迹。这使我们能够以自监督方式学习表示。我们表明,使用运动来表示视频实际上解决了视频技术的两个核心局限性。首先,它允许我们大幅度减少训练数据的规模,因为运动本质上与外观无关,因此需要更少的样本就能良好泛化。其次,运动允许我们绕过语言依赖的训练范式,学习更细粒度的概念。结果得到的嵌入称为 TIME(Temporally Informed Motion Embedding),这是一种仅使用合成运动数据训练的表示。我们在广泛的任务上进行零样本测试。我们观察到,无需任何花哨技巧,性能与使用最高多达 4 个数量级训练数据的前沿模型相当。这为构建更具时序意识且更可扩展的视频模型范式铺平了道路。
引用
@article{arxiv.2605.23045,
title = {The TIME Machine: On The Power of Motion for Efficient Perception},
author = {Mantas Skackauskas and Xinyue Hao and Laura Sevilla-Lara},
journal= {arXiv preprint arXiv:2605.23045},
year = {2026}
}