中文

Story-Iter: 一种用于长故事可视化的免训练迭代范式

计算机视觉与模式识别 2026-02-17 v3

摘要

本文介绍了 Story-Iter,一种新的免训练迭代范式,用于增强长故事生成。与依赖固定参考图像构建完整故事的现有方法不同,我们的方法采用一种新颖的外部迭代范式,超越了扩散模型的内部迭代去噪步骤,通过整合上一轮的所有参考图像来不断优化每个生成的图像。为了实现这一点,我们提出了一个即插即用、免训练的全局参考交叉注意力(GRCA)模块,用全局嵌入对所有参考帧进行建模,确保长序列中的语义一致性。通过逐步融入整体视觉上下文和文本约束,我们的迭代范式能够实现具有细粒度交互的精确生成,逐步优化故事可视化。在官方故事可视化数据集和我们构建的长故事基准上的大量实验表明,Story-Iter 在长故事可视化(多达 100 帧)方面达到了最先进的性能,在语义一致性和细粒度交互方面均表现出色。

关键词

引用

@article{arxiv.2410.06244,
  title  = {Story-Iter: A Training-free Iterative Paradigm for Long Story Visualization},
  author = {Jiawei Mao and Xiaoke Huang and Yunfei Xie and Yuanqi Chang and Mude Hui and Bingjie Xu and Zeyu Zheng and Zirui Wang and Cihang Xie and Yuyin Zhou},
  journal= {arXiv preprint arXiv:2410.06244},
  year   = {2026}
}

备注

31 pages, 33 figures, The project page and associated code can be accessed via https://jwmao1.github.io/storyiter/