中文

展示:基于扩散模型的指令图像与视频生成统一框架

计算机视觉与模式识别 2025-11-25 v1

摘要

在给定情境中生成视觉指令是开发交互式世界模拟器的关键任务。虽然先前工作通过文本引导的图像操作或视频预测来解决此问题,但这些任务通常在孤立的情况下被处理。这种分离暴露出一个根本问题:图像操作方法忽略了动作如何随时间展开,而视频预测模型又常常忽略了预期的结果。为此,我们提出ShowMe框架,通过选择性激活视频扩散模型的空间和时间组件,实现两者任务的统一。此外,我们引入结构一致性和运动一致性奖励,以提高结构保真度和时间连贯性。值得注意的是,这种统一带来了双重好处:通过视频预训练获得的空间知识增强了非刚性图像编辑的情境一致性和真实性;而指令引导的操纵阶段则使模型在视频预测中具备更强的目标导向推理能力。在多样化基准上的实验表明,我们的方法在指令图像和视频生成方面均优于专家模型,凸显了视频扩散模型作为统一动作-对象状态转换器的优势。

关键词

引用

@article{arxiv.2511.17839,
  title  = {Show Me: Unifying Instructional Image and Video Generation with Diffusion Models},
  author = {Yujiang Pu and Zhanbo Huang and Vishnu Boddeti and Yu Kong},
  journal= {arXiv preprint arXiv:2511.17839},
  year   = {2025}
}

备注

Accepted by WACV 2026