MagicTime:作为 metamorphic 模拟器的延时视频生成模型
计算机视觉与模式识别
2025-04-08 v2
摘要
近期,文本到视频生成(T2V)在从文本描述合成高质量通用视频方面取得了显著成功。T2V 中一个很大程度上被忽视的问题是,现有模型未能充分编码真实世界的物理知识,因此生成的视频往往运动有限且变化贫乏。在本文中,我们提出了 \textbf{MagicTime},一个 metamorphic 延时视频生成模型,它从延时视频中学习真实世界的物理知识并实现 metamorphic 生成。首先,我们设计了 MagicAdapter 方案来解耦空间和时间训练,从 metamorphic 视频中编码更多物理知识,并转换预训练的 T2V 模型以生成 metamorphic 视频。其次,我们引入了动态帧提取策略以适应具有更广变化范围并涵盖剧烈物体 metamorphic 过程的 metamorphic 延时视频,从而体现比通用视频更多的物理知识。最后,我们引入了 Magic 文本编码器以改善对 metamorphic 视频提示的理解。此外,我们创建了一个名为 \textbf{ChronoMagic} 的延时视频-文本数据集,专门用于解锁 metamorphic 视频生成能力。大量实验证明了 MagicTime 在生成高质量和动态 metamorphic 视频方面的优越性和有效性,表明延时视频生成是构建真实世界 metamorphic 模拟器的一条有前景的路径。代码:https://github.com/PKU-YuanGroup/MagicTime
引用
@article{arxiv.2404.05014,
title = {MagicTime: Time-lapse Video Generation Models as Metamorphic Simulators},
author = {Shenghai Yuan and Jinfa Huang and Yujun Shi and Yongqi Xu and Ruijie Zhu and Bin Lin and Xinhua Cheng and Li Yuan and Jiebo Luo},
journal= {arXiv preprint arXiv:2404.05014},
year = {2025}
}
备注
TPAMI 2025