中文

生成式视频传递

计算机视觉与模式识别 2024-12-30 v1

摘要

大规模视频生成模型具有现实建模自然场景的内在能力。本文演示了通过精心设计的生成式视频传递框架,能够以统一的方式解决多种视频任务,利用这些模型的生成能力。具体而言,我们提出的框架GenProp使用选择性内容编码器对原始视频进行编码,并通过图像到视频生成模型传递对第一帧所做的修改。我们提出了一种基于实例级别视频分割数据集的数据生成方案,以覆盖多种视频任务。该模型通过引入掩码预测解码器头并优化区域感知损失进行训练,以帮助编码器保留原始内容,同时生成模型传递修改后的区域。这种新颖的设计开辟了新的可能性:在编辑场景中,GenProp允许对对象形状进行大幅修改;在插入场景中,插入的对象可以表现出独立的运动;在移除场景中,GenProp有效地从整个视频中移除阴影和反射等效果;在跟踪场景中,GenProp能够一起跟踪物体及其相关联的效果。实验结果表明,我们的模型在各种视频任务中表现领先,并进一步对所提出框架进行深入分析。

关键词

引用

@article{arxiv.2412.19761,
  title  = {Generative Video Propagation},
  author = {Shaoteng Liu and Tianyu Wang and Jui-Hsien Wang and Qing Liu and Zhifei Zhang and Joon-Young Lee and Yijun Li and Bei Yu and Zhe Lin and Soo Ye Kim and Jiaya Jia},
  journal= {arXiv preprint arXiv:2412.19761},
  year   = {2024}
}

备注

11 pages, 18 figures