One-Prompt-One-Story:基于单一提示的无训练一致文本到图像生成
计算机视觉与模式识别
2025-02-06 v3 人工智能
机器学习
摘要
文本到图像生成模型能够从输入提示创建高质量图像,但在支持身份保持的叙事一致生成方面存在挑战。现有方法通常需要在大型数据集上进行大量训练或对原始模型架构进行额外修改。这限制了其在不同领域和多样化扩散模型配置中的适用性。本文首先观察到语言模型具有内在的上下文一致性,能够通过单一提示理解身份。借鉴这种内在的上下文一致性,我们提出了一种新颖的无训练一致文本到图像(T2I)生成方法,称为“One-Prompt-One-Story”(1Prompt1Story)。我们的方法将1Prompt1Story将所有提示拼接成单个输入供T2I扩散模型使用,最初保留角色身份。随后通过两种新技术(奇异值重加权和身份保持交叉注意力)来细化生成过程,确保每个帧与输入描述更好地对齐。在实验中,我们将该方法与各种现有的一致T2I生成方法进行比较,通过定量指标和定性评估 demonstrate其有效性。代码可在 https://github.com/byliutao/1Prompt1Story 获取。
引用
@article{arxiv.2501.13554,
title = {One-Prompt-One-Story: Free-Lunch Consistent Text-to-Image Generation Using a Single Prompt},
author = {Tao Liu and Kai Wang and Senmao Li and Joost van de Weijer and Fahad Shahbaz Khan and Shiqi Yang and Yaxing Wang and Jian Yang and Ming-Ming Cheng},
journal= {arXiv preprint arXiv:2501.13554},
year = {2025}
}
备注
28 pages, 22 figures, ICLR2025 conference