Frame In-N-Out:无界可控的图像到视频生成
计算机视觉与模式识别
2025-10-27 v2
摘要
可控性、时间连贯性和细节合成仍然是视频生成中最关键的挑战。在本文中,我们关注一种常用但尚未被充分探索的电影技术,称为 Frame In 和 Frame Out。具体而言,从图像到视频生成出发,用户可以控制图像中的对象自然离开场景,或者在用户指定的运动轨迹引导下,提供突破性的新身份参考进入场景。为支持这一任务,我们引入了一个半自动筛选的新数据集、一种高效的保持身份且运动可控的视频 Diffusion Transformer 架构,以及针对该任务的全面评估协议。我们的评估表明,我们提出的方法显著优于现有基线。
引用
@article{arxiv.2505.21491,
title = {Frame In-N-Out: Unbounded Controllable Image-to-Video Generation},
author = {Boyang Wang and Xuweiyi Chen and Matheus Gadelha and Zezhou Cheng},
journal= {arXiv preprint arXiv:2505.21491},
year = {2025}
}