图像到视频生成中的自导轨控制:SG-I2V框架
计算机视觉与模式识别
2025-02-26 v3 机器学习
摘要
图像到视频生成的方法已取得惊人的数据格点质量。然而,调整生成视频中特定元素(如物体运动或相机移动)常常是一项繁琐的试错过程,例如涉及以不同随机种子重新生成视频。最近的技术通过微调预训练模型以遵循条件信号(如边界框或点轨迹)来解决此问题。然而,这种微调过程可能昂贵且需要带有标注物体运动的数据集,而这类数据集可能难以获取。本文引入 SG-I2V,一个无导轨控制的图像到视频生成框架,完全依赖预训练图像到视频扩散模型中存在的知识,无需微调或外部知识。我们的零样本方法在视觉质量和运动保真度方面均优于无监督基线,同时显著缩小了与受监督模型之间的性能差距。更多细节和视频结果可在我们的项目页面上查阅:https://kmcode1.github.io/Projects/SG-I2V
引用
@article{arxiv.2411.04989,
title = {SG-I2V: Self-Guided Trajectory Control in Image-to-Video Generation},
author = {Koichi Namekata and Sherwin Bahmani and Ziyi Wu and Yash Kant and Igor Gilitschenski and David B. Lindell},
journal= {arXiv preprint arXiv:2411.04989},
year = {2025}
}
备注
ICLR 2025. Project page: https://kmcode1.github.io/Projects/SG-I2V/