Owl-1:用于一致长视频生成的全能世界模型
计算机视觉与模式识别
2024-12-13 v1 人工智能
机器学习
摘要
视频生成模型(VGMs)近期受到广泛关注,因其作为通用大型视觉模型的潜在候选人而备受青睐。然而,这些模型每次只能生成短视频,现有方法通过迭代调用VGMs来实现长视频生成,采用最后一帧的输出作为下一轮生成的条件。但最后一帧仅包含场景的短期细粒度信息,导致在长时间尺度上不一致。为解决此问题,我们提出了全能世界模型(Owl-1),用于为一致的长视频生成生成长期连贯且全面的条件。由于视频是底层演化世界的观测,我们提出在潜在空间中建模长期发展,并使用VGMs将其拍摄成视频。具体而言,我们表示一个包含可解码为显式视频观测的状态变量。这些观测作为预测时间动态的基础,该动态又更新状态变量。 evolving dynamics 与持久状态之间的相互作用增强了长视频的多样性和一致性。大量实验表明,Owl-1 在 VBench-I2V 和 VBench-Long 上与 SOTA 方法表现相当,验证了其生成高质量视频观测的能力。代码:https://github.com/huang-yh/Owl。
引用
@article{arxiv.2412.09600,
title = {Owl-1: Omni World Model for Consistent Long Video Generation},
author = {Yuanhui Huang and Wenzhao Zheng and Yuan Gao and Xin Tao and Pengfei Wan and Di Zhang and Jie Zhou and Jiwen Lu},
journal= {arXiv preprint arXiv:2412.09600},
year = {2024}
}
备注
Code is available at: https://github.com/huang-yh/Owl