DreamInsert:基于单张图像的零样本图像到视频对象插入
计算机视觉与模式识别
2025-03-14 v1
摘要
生成式扩散模型的近期发展将许多梦想变为现实。对于视频对象插入,现有方法通常需要额外信息,如参考视频或对象的 3D 资产,以生成合成运动。然而,由于缺乏未见的运动信息,尝试从单张参考照片插入目标背景视频中的对象仍是未开辟的领域。我们提出了 DreamInsert,首次实现无训练的图像到视频对象插入。通过考虑对象轨迹,DreamInsert 能够预测未见对象的运动,将其与背景视频和谐融合,并生成所需的视频。更重要的是,DreamInsert 既简单又有效,在无需在精心设计的图像-视频数据对上进行端到端训练或额外微调的情况下,实现了零样本插入。我们通过多项实验展示了 DreamInsert 的有效性。我们展示了首次以无训练方式实现图像到视频对象插入的结果,为未来内容创建和合成开辟了激动人心的新方向。代码将很快公开。
引用
@article{arxiv.2503.10342,
title = {DreamInsert: Zero-Shot Image-to-Video Object Insertion from A Single Image},
author = {Qi Zhao and Zhan Ma and Pan Zhou},
journal= {arXiv preprint arXiv:2503.10342},
year = {2025}
}