中文

一致性故事生成:释放锯齿采样的潜力

计算机视觉与模式识别 2025-11-11 v5

摘要

文本到图像生成模型在从文本描述生成高质量图像方面取得了显著进展,但它们仍然难以在多张图像之间保持主体一致性,这是视觉叙事的基本要求。现有方法试图通过在大规模故事可视化数据集上微调模型来解决这一问题(资源密集),或通过使用跨生成共享信息的免训练技术(效果仍然有限)。在本文中,我们提出了一种新颖的免训练采样策略——锯齿采样结合非对称提示与视觉共享,以增强视觉故事生成中的主体一致性。我们的方法提出了一种锯齿采样机制,在非对称提示之间交替以保留主体特征,同时视觉共享模块在生成的图像之间传递视觉线索以进一步强化一致性。基于定量指标和定性评估的实验结果表明,我们的方法在生成连贯且一致的视觉故事方面显著优于先前方法。代码可在 https://github.com/Mingxiao-Li/Asymmetry-Zigzag-StoryDiffusion 获取。

关键词

引用

@article{arxiv.2506.09612,
  title  = {Consistent Story Generation: Unlocking the Potential of Zigzag Sampling},
  author = {Mingxiao Li and Mang Ning and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2506.09612},
  year   = {2025}
}

备注

20 pages, 10 figures