中文

想象 yourself:无调谐的个人化图像生成

计算机视觉与模式识别 2024-09-23 v1 人工智能

摘要

扩散模型在 various 图像到图像任务中展现出惊人的效能。本研究引入了 Imagine yourself,一个面向个人化图像生成的 state-of-the-art 模型。不同于传统的基于调谐的个人化技术,Imagine yourself 作为无调谐模型运行,使所有用户都能在共享框架下使用而无需个体化调整。此前的工作在平衡身份保持、遵循复杂提示和保持良好视觉质量方面存在挑战,导致模型对参考图像具有强烈的复制粘贴效应,难以生成需要对参考图像进行显著变化的图像,例如更改面部表情、头部和身体姿态,生成图像的多样性也较低。为解决这些限制,我们的方法引入了 1) 一种新的合成配对数据生成机制以鼓励图像多样性,2) 一种完全并行注意力架构,包含三个文本编码器和一个完全可训练的视觉编码器以提高文本忠实度,以及 3) 一种新颖的粗到细多阶段微调方法,以逐步推进视觉质量的边界。我们的研究表明,Imagine yourself 超越了当前最先进的个人化模型,在身份保持、视觉质量和文本对齐方面展现出卓越的能力。该模型为 various 个人化应用奠定了稳健的基础。人类评估结果验证了该模型在所有方面(身份保持、文本忠实度和视觉吸引力)方面超越了以前的个人化模型的 SOTA 优势。

关键词

引用

@article{arxiv.2409.13346,
  title  = {Imagine yourself: Tuning-Free Personalized Image Generation},
  author = {Zecheng He and Bo Sun and Felix Juefei-Xu and Haoyu Ma and Ankit Ramchandani and Vincent Cheung and Siddharth Shah and Anmol Kalia and Harihar Subramanyam and Alireza Zareian and Li Chen and Ankit Jain and Ning Zhang and Peizhao Zhang and Roshan Sumbaly and Peter Vajda and Animesh Sinha},
  journal= {arXiv preprint arXiv:2409.13346},
  year   = {2024}
}