AnyI2V:基于运动控制的任意条件图像动画化
计算机视觉与模式识别
2025-07-04 v1
摘要
视频生成的最新进展,特别是在扩散模型方面,推动了文本到视频(T2V)和图像到视频(I2V)合成的显著进步。然而,在有效整合动态运动信号和灵活的空间约束方面仍然存在挑战。现有的T2V方法通常依赖于文本提示,这本质上缺乏对生成内容空间布局的精确控制。相比之下,I2V方法受限于其对真实图像的依赖,这限制了合成内容的可编辑性。尽管一些方法引入了ControlNet来加入基于图像的条件,但它们通常缺乏显式的运动控制,并且需要计算成本高昂的训练。为了解决这些局限性,我们提出了AnyI2V,一个无需训练的框架,它可以使用用户定义的运动轨迹对任意条件图像进行动画化。AnyI2V支持更广泛的模态作为条件图像,包括ControlNet不支持的数据类型,如网格和点云,从而实现更灵活和通用的视频生成。此外,它还支持混合条件输入,并通过LoRA和文本提示实现风格迁移和编辑。大量实验表明,所提出的AnyI2V实现了优越的性能,并为空间和运动控制的视频生成提供了新的视角。代码可在https://henghuiding.com/AnyI2V/获取。
引用
@article{arxiv.2507.02857,
title = {AnyI2V: Animating Any Conditional Image with Motion Control},
author = {Ziye Li and Hao Luo and Xincheng Shuai and Henghui Ding},
journal= {arXiv preprint arXiv:2507.02857},
year = {2025}
}
备注
ICCV 2025, Project Page: https://henghuiding.com/AnyI2V/