基于遮罩的运动轨迹实现图像到视频生成
计算机视觉与模式识别
2025-01-07 v1 人工智能
机器学习
摘要
我们考虑图像到视频(I2V)生成任务,即将静态图像转换为基于文本描述的逼真视频序列。虽然近期进展产生了逼真的输出,但频繁在准确且一致的对象运动方面存在挑战,尤其是在多对象场景下。为此,我们提出了一种两阶段组成框架,将I2V生成分解为:(i)显式中间表示生成阶段,随后是(ii)以该表示为条件的视频生成阶段。我们的关键创新是引入基于遮罩的运动轨迹作为中间表示,既捕获语义对象信息,又捕获运动信息,从而实现对运动和语义的既表达又紧凑的表示。为将所学表示融入第二阶段,我们利用对象级别注意力目标。具体而言,我们考虑空间、每个对象的遮罩交叉注意力目标,将对象特定的提示整合到相应的潜在空间区域,并考虑遮罩时空自注意力目标,确保每个对象的帧间一致性。我们在具有挑战性的基准测试上进行评估,包括多对象和高运动场景,实证表明所提方法在时间一致性、运动真实性和文本提示忠实性方面实现了最先进的效果。此外,我们引入了benchmark—a一个用于单对象和多对象I2V生成的新型挑战性基准,证明了该方法在该基准上的优势。项目页面地址为https://guyyariv.github.io/TTM/。
引用
@article{arxiv.2501.03059,
title = {Through-The-Mask: Mask-based Motion Trajectories for Image-to-Video Generation},
author = {Guy Yariv and Yuval Kirstain and Amit Zohar and Shelly Sheynin and Yaniv Taigman and Yossi Adi and Sagie Benaim and Adam Polyak},
journal= {arXiv preprint arXiv:2501.03059},
year = {2025}
}