中文

PhotoVerse:基于文本到图像扩散模型的免调优图像定制

计算机视觉与模式识别 2023-09-13 v1 人工智能

摘要

个性化文本到图像生成已成为一种强大且广受青睐的工具,使用户能够根据其特定概念与提示词创建定制化图像。然而,现有的个性化方法面临多重挑战,包括调优时间长、存储需求大、每个身份需要多张输入图像,以及在身份保持与可编辑性方面的局限。为应对这些障碍,我们提出 PhotoVerse,一种创新方法,在文本与图像域中引入双分支条件机制,对图像生成过程提供有效控制。此外,我们引入人脸身份损失作为新组件,以增强训练过程中身份的保持。值得注意的是,我们提出的 PhotoVerse 消除了测试时调优的需求,且仅依赖目标身份的一张人脸照片,显著降低了图像生成的资源开销。在单次训练阶段后,我们的方法能够在仅几秒内生成高质量图像。而且,我们的方法可生成涵盖多种场景与风格的多样化图像。大量评估表明了我们方法的优越性能,其实现了身份保持与可编辑性的双重目标。项目页面:https://photoverse2d.github.io/

关键词

引用

@article{arxiv.2309.05793,
  title  = {PhotoVerse: Tuning-Free Image Customization with Text-to-Image Diffusion Models},
  author = {Li Chen and Mengyi Zhao and Yiheng Liu and Mingxu Ding and Yangyang Song and Shizun Wang and Xu Wang and Hao Yang and Jing Liu and Kang Du and Min Zheng},
  journal= {arXiv preprint arXiv:2309.05793},
  year   = {2023}
}