Dynamic-I2V:基于多模态大语言模型的图像到视频生成模型探索
计算机视觉与模式识别
2025-06-04 v3
摘要
近期,图像到视频(I2V)生成在常规场景中展现出了可喜的性能。然而,在处理需要对细微运动和复杂物体-动作关系有深入理解的复杂场景时,这些方法仍面临重大挑战。为了应对这些挑战,我们提出了 Dynamic-I2V,这是一个集成多模态大语言模型(MLLM)的创新框架,用于为扩散Transformer(DiT)架构联合编码视觉和文本条件。通过利用 MLLM 先进的多模态理解能力,我们的模型显著提升了合成视频的运动可控性和时间连贯性。Dynamic-I2V 固有的多模态特性进一步使其能够灵活支持多种条件输入,将其适用性扩展到各种下游生成任务。通过系统分析,我们发现了当前 I2V 基准测试中的一个关键局限:由于运动复杂性与视觉质量指标之间缺乏平衡,存在严重偏向低动态视频的偏差。为了弥补这一评估空白,我们提出了 DIVE——一种专为 I2V 生成中全面动态质量测量而设计的新型评估基准。总之,大量定量和定性实验证实,Dynamic-I2V 在图像到视频生成中达到了 SOTA 性能,特别地,与现有方法相比,在 DIVE 指标的评估下,其动态范围、可控性和质量分别显著提升了 42.5%、7.9% 和 11.8%。
引用
@article{arxiv.2505.19901,
title = {Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM},
author = {Peng Liu and Xiaoming Ren and Fengkai Liu and Qingsong Xie and Quanlong Zheng and Yanhao Zhang and Haonan Lu and Yujiu Yang},
journal= {arXiv preprint arXiv:2505.19901},
year = {2025}
}