中文

天选之子:文本到图像扩散模型中一致角色的生成

计算机视觉与模式识别 2024-07-16 v4 图形学 机器学习

摘要

近期文本到图像生成模型的进展为视觉创意解锁了巨大潜力。然而,使用这些模型的用户难以生成一致的角色,而这是故事可视化、游戏开发、资产设计、广告等诸多实际应用的关键方面。当前方法通常依赖于目标角色的多个已有图像或涉及劳动密集的手动过程。在本工作中,我们提出了一种完全自动化的一致角色生成方案,唯一输入为文本提示。我们引入一种迭代过程,在每个阶段识别一组共享相似身份的一致图像,并从该集合中提取更具一致性的身份。我们的定量分析表明,与基线方法相比,我们的方法在提示对齐与身份一致性之间取得了更好的平衡,且用户研究强化了这些发现。最后,我们展示了我们方法的若干实际应用。

关键词

引用

@article{arxiv.2311.10093,
  title  = {The Chosen One: Consistent Characters in Text-to-Image Diffusion Models},
  author = {Omri Avrahami and Amir Hertz and Yael Vinker and Moab Arar and Shlomi Fruchter and Ohad Fried and Daniel Cohen-Or and Dani Lischinski},
  journal= {arXiv preprint arXiv:2311.10093},
  year   = {2024}
}

备注

Accepted to SIGGRAPH 2024. Project page is available at https://omriavrahami.com/the-chosen-one/