Pix2Gif:用于 GIF 生成的运动引导扩散
计算机视觉与模式识别
2024-03-11 v2 人工智能
摘要
我们提出了 Pix2Gif,一种用于图像到 GIF(视频)生成的运动引导扩散模型。我们以不同的方式处理这一问题,将该任务表述为由文本和运动幅度提示引导的图像翻译问题,如预告图所示。为确保模型遵循运动引导,我们提出了一个新的运动引导扭曲模块,以在两种提示的条件下对源图像的特征进行空间变换。此外,我们引入了感知损失,以确保变换后的特征图保持在目标图像的同一空间内,从而确保内容的一致性和连贯性。为了准备模型训练,我们通过从 TGIF 视频字幕数据集中提取连贯的图像帧来精心整理数据,该数据集提供了关于主体时间变化的丰富信息。预训练后,我们将模型以零样本方式应用于多个视频数据集。大量的定性和定量实验证明了我们模型的有效性——它不仅捕获了来自文本的语义提示,还捕获了来自运动引导的空间提示。我们使用单节点 16xV100 GPU 训练所有模型。代码、数据集和模型已公开于:https://hiteshk03.github.io/Pix2Gif/。
关键词
引用
@article{arxiv.2403.04634,
title = {Pix2Gif: Motion-Guided Diffusion for GIF Generation},
author = {Hitesh Kandala and Jianfeng Gao and Jianwei Yang},
journal= {arXiv preprint arXiv:2403.04634},
year = {2024}
}