中文

训练无需的一致文本到图像生成

计算机视觉与模式识别 2024-05-31 v3 人工智能 图形学 机器学习

摘要

文本到图像模型通过允许用户通过自然语言指导图像生成过程,提供了新的创作灵活性。然而,这些模型在使用多样化提示词时,持续地表现相同的主体仍然具有挑战性。现有的做法需要对模型进行微调,以教会它描述特定用户提供主体的新词,或添加图像条件。这些方法需要针对每个主体进行繁长的优化,或进行大规模预训练。此外,它们难以将生成图像与文本提示对齐,并在表现多个主体方面面临困难。我们提出了ConsiStory(一致性故事),一种无需训练的方法,通过共享预训练模型的内部激活来实现主体一致生成。我们引入了主体驱动的共享注意力块和基于对应性的特征注入,以促进图像之间主体的一致性。此外,我们开发了策略以在保持主体一致性的同时鼓励布局多样性。我们将ConsiStory与多种基线方法进行比较,展示在主体一致性和文本对齐方面实现了最先进的性能,而无需进行任何优化步骤。最后,ConsiStory可以自然地扩展到多主体场景,甚至能够为常见对象实现无需训练的个人化。

关键词

引用

@article{arxiv.2402.03286,
  title  = {Training-Free Consistent Text-to-Image Generation},
  author = {Yoad Tewel and Omri Kaduri and Rinon Gal and Yoni Kasten and Lior Wolf and Gal Chechik and Yuval Atzmon},
  journal= {arXiv preprint arXiv:2402.03286},
  year   = {2024}
}

备注

Accepted to journal track of SIGGRAPH 2024 (TOG). Project page is at https://consistory-paper.github.io