VideoJAM:用于增强视频模型中运动生成的联合外观-运动表示
计算机视觉与模式识别
2025-05-27 v2
摘要
尽管近期取得了显著进展,生成式视频模型仍然难以捕捉真实世界的运动、动态与物理。我们指出,这一局限性源于常规的像素重建目标,该目标倾向于在运动连贯性方面让模型更关注外观保真度。在此基础上,我们提出了 VideoJAM—a一种新型框架,通过鼓励模型学习联合外观-运动表示来为视频生成器植入有效的运动先验。VideoJAM 由两个互补单元构成。在训练阶段,我们扩展目标,预测单个学习表示对应的像素及其运动。在推理阶段,我们引入 Inner-Guidance(内部引导)机制,利用模型自身演化的运动预测作为动态引导信号,以实现对连贯运动的引导。值得注意的是,本框架可应用于任何视频模型,无需修改训练数据或扩大模型规模。VideoJAM 在运动连贯性方面实现了与高度竞争的专有模型相当乃至更优的性能,同时也提升了生成内容的感知视觉质量。这些发现表明,外观与运动可以是互补的,有效集成后可提升生成视频的视觉质量与连贯性。项目网站:https://hila-chefer.github.io/videojam-paper.github.io/
引用
@article{arxiv.2502.02492,
title = {VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models},
author = {Hila Chefer and Uriel Singer and Amit Zohar and Yuval Kirstain and Adam Polyak and Yaniv Taigman and Lior Wolf and Shelly Sheynin},
journal= {arXiv preprint arXiv:2502.02492},
year = {2025}
}