中文

为文本到图像定制生成多图像合成数据

计算机视觉与模式识别 2025-10-14 v2 图形学 机器学习

摘要

文本到图像模型的定制化使用户能够插入新概念或物体,并在未见过的场景中生成它们。现有方法要么依赖于相对昂贵的测试时优化,要么在缺乏多图像监督的单图像数据集上训练编码器,这可能限制图像质量。我们提出了一种简单的方法来应对这些挑战。我们首先利用现有的文本到图像模型和3D数据集,创建一个高质量的合成定制数据集(SynCD),该数据集包含同一物体在不同光照、背景和姿态下的多张图像。利用该数据集,我们训练了一个基于编码器的模型,该模型通过共享注意力机制整合来自参考图像的细粒度视觉细节。最后,我们提出了一种推理技术,对文本和图像引导向量进行归一化,以减轻采样图像中的过曝问题。通过大量实验,我们表明,在SynCD上训练并结合所提出的推理算法的基于编码器的模型,在标准定制基准上优于现有的基于编码器的方法。

关键词

引用

@article{arxiv.2502.01720,
  title  = {Generating Multi-Image Synthetic Data for Text-to-Image Customization},
  author = {Nupur Kumari and Xi Yin and Jun-Yan Zhu and Ishan Misra and Samaneh Azadi},
  journal= {arXiv preprint arXiv:2502.01720},
  year   = {2025}
}

备注

ICCV 2025. Project webpage: https://www.cs.cmu.edu/~syncd-project/