中文

Infinite-Story:基于无训练的一致文本到图像生成

计算机视觉与模式识别 2025-11-18 v1

摘要

我们提出了 Infinite-Story,一个针对多提示叙事场景的无训练一致文本到图像(T2I)生成框架。基于尺度自回归模型,本方法解决了一致文本到图像生成中的两个关键问题:身份不一致和风格不一致。为克服这些问题,我们引入了三种互补技术:身份提示替换(Identity Prompt Replacement),可减轻文本编码器中的上下文偏差,从而在不同提示之间对齐身份属性;以及由自适应风格注入(Adaptive Style Injection)和同步引导适应(Synchronized Guidance Adaptation)构成的统一注意力引导机制,联合实现全局风格和身份外观的一致性,同时保持提示保真度。不同于需要微调或推理速度慢的基于扩散的方法,Infinite-Story完全在测试阶段运行,能在多样化提示下实现高度的身份和风格一致性。大量实验表明,我们的方法在生成性能上达到最先进水平,推理速度比现有最快的一致文本到图像模型快超过6倍(每张图像仅需1.72秒),凸显了其在实际视觉叙事中的有效性和实用性。

关键词

引用

@article{arxiv.2511.13002,
  title  = {Infinite-Story: A Training-Free Consistent Text-to-Image Generation},
  author = {Jihun Park and Kyoungmin Lee and Jongmin Gim and Hyeonseo Jo and Minseok Oh and Wonhyeok Choi and Kyumin Hwang and Jaeyeul Kim and Minwoo Choi and Sunghoon Im},
  journal= {arXiv preprint arXiv:2511.13002},
  year   = {2025}
}

备注

18pages, 13 figures, AAAI 2026 Oral