视频模型是零样本学习器与推理器
机器学习
2025-10-01 v2 人工智能
计算机视觉与模式识别
机器人学
摘要
大型语言模型(LLMs)显著的零样本能力推动了自然语言处理从任务特定模型向统一的通用基础模型转变。这一转变源于简单的原始要素:在网页规模数据上训练的大型生成模型。值得注意的是,同样的原始要素也适用于当今的生成视频模型。视频模型是否正朝着通用视觉理解的方向发展,就像 LLMs 发展出通用语言理解一样?我们证明 Veo 3 能够解决一系列它未被明确训练的任务:分割物体、检测边缘、编辑图像、理解物理属性、识别物体可用性、模拟工具使用等。这些感知、建模和操作视觉世界的能力使早期形式的视觉推理成为可能,如迷宫求解与对称性求解。Veo 涌现的零样本能力表明视频模型正走在成为统一的通用视觉基础模型的道路上。
引用
@article{arxiv.2509.20328,
title = {Video models are zero-shot learners and reasoners},
author = {Thaddäus Wiedemer and Yuxuan Li and Paul Vicol and Shixiang Shane Gu and Nick Matarese and Kevin Swersky and Been Kim and Priyank Jaini and Robert Geirhos},
journal= {arXiv preprint arXiv:2509.20328},
year = {2025}
}
备注
Project page: https://video-zero-shot.github.io/