AID:适用于指令引导视频预测的图像到视频扩散模型适应方法
计算机视觉与模式识别
2024-06-11 v1 人工智能
计算与语言
机器学习
多媒体
摘要
文本引导视频预测(TVP)涉及根据指令从初始帧预测未来帧的运动,具有广泛的应用场景,包括虚拟现实、机器人和内容创建。以往的TVP方法通过改造稳定扩散模型取得了显著进展,但主要因视频数据规模有限而在帧一致性和时序稳定性方面受限。我们观察到,预训练的Image2Video扩散模型具有良好的视频动力学先验,但缺乏文本控制。因此,将Image2Video模型迁移以利用其视频动力学先验,同时注入指令控制以生成可控视频,既是有意义又具有挑战性的任务。为实现这一目标,我们引入多模态大语言模型(MLLM),根据初始帧和文本指令预测未来视频状态。具体而言,我们设计了dual query transformer(DQFormer)架构,将指令和帧整合到未来帧预测的条件嵌入中。此外,我们开发了长短期时序适配器和空间适配器,能够以最小的训练成本将通用视频扩散模型快速迁移到特定场景。实验结果表明,我们的方法在四个数据集上显著优于最先进的技术:Something Something V2、Epic Kitchen-100、Bridge Data和UCF-101。值得注意的是,AID在Bridge和SSv2上的FVD分别提高了91.2%和55.5%,显示其在各类场景中的有效性。更多示例可访问我们的网站https://chenhsing.github.io/AID。
引用
@article{arxiv.2406.06465,
title = {AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction},
author = {Zhen Xing and Qi Dai and Zejia Weng and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2406.06465},
year = {2024}
}