中文

StorySync:通过区域融合实现文本到图像生成中的无训练主体一致性

计算机视觉与模式识别 2025-08-07 v1 人工智能

摘要

使用文本到图像扩散模型生成讲叙事的图像序列时,常面临在所有故事场景中维持主体一致性的关键挑战。现有方法通常依赖微调或重新训练模型,计算成本高昂、耗时且可能干扰模型的既有功能。在本文中,我们采用训练-free方法,提出一种高效的一致主体生成方法。该方法可无缝集成到预训练扩散模型中,通过引入掩码跨图像注意力共享来动态对齐主体特征,并通过区域特征融合来细化视觉上相似的细节,以实现更好的主体一致性。实验结果表明,我们的方法成功在各种场景下生成视觉上一致的主体,同时保持扩散模型的创造能力。

关键词

引用

@article{arxiv.2508.03735,
  title  = {StorySync: Training-Free Subject Consistency in Text-to-Image Generation via Region Harmonization},
  author = {Gopalji Gaur and Mohammadreza Zolfaghari and Thomas Brox},
  journal= {arXiv preprint arXiv:2508.03735},
  year   = {2025}
}

备注

14 pages, 10 figures, GCPR