中文

iMontage:统一、通用、高度动态的多对多图像生成

计算机视觉与模式识别 2025-12-02 v2

摘要

预训练的视频模型学习了生成高质量、时间连贯内容的强大先验。虽然这些模型在时间连贯性方面表现出色,但其动态性常常受到训练数据连续性的限制。我们假设,通过将图像数据中丰富且不受约束的内容多样性注入到这个连贯的时间框架中,我们可以生成具有自然过渡和更广泛动态范围的图像集。为此,我们引入了iMontage,一个旨在将强大的视频模型重新用作全能图像生成器的统一框架。该框架消费并产生可变长度的图像集,统一了广泛的图像生成和编辑任务。为实现这一目标,我们提出了一种优雅且微创的适应策略,辅以定制的数据整理过程和训练范式。这种方法使模型能够获得广泛的图像操作能力,而不会破坏其宝贵的原始运动先验。iMontage在几个主流的多进多出任务中表现出色,不仅保持了强大的跨图像上下文一致性,而且生成了超越常规范围的非凡动态场景。访问我们的主页:https://kr1sjfu.github.io/iMontage-web/。

关键词

引用

@article{arxiv.2511.20635,
  title  = {iMontage: Unified, Versatile, Highly Dynamic Many-to-many Image Generation},
  author = {Zhoujie Fu and Xianfang Zeng and Jinghong Lan and Xinyao Liao and Cheng Chen and Junyi Chen and Jiacheng Wei and Wei Cheng and Shiyu Liu and Yunuo Chen and Gang Yu and Guosheng Lin},
  journal= {arXiv preprint arXiv:2511.20635},
  year   = {2025}
}

备注

Our homepage: https://kr1sjfu.github.io/iMontage-web/