中文

IMAGE-ALCHEMY: advancing 个人化文本到图像生成中的主体保真度

计算机视觉与模式识别 2025-05-19 v1

摘要

近期的文本到图像扩散模型,特别是 Stable Diffusion,已实现高度细致和语义丰富的图像生成。然而,基于少量参考图像将这些模型个人化以代表新主题仍具有挑战性。这常导致灾难性遗忘、过拟合或大量计算开销。我们提出了一个两阶段管道,通过在 Stable Diffusion XL (SDXL) 模型 U-Net 中的注意力权重内的 LoRA-based 微调来解决这些限制。首先,我们使用未修改的 SDXL 生成通过将主题替换为其类别标签而生成的通用场景。然后,我们通过一种以分割驱动的图像到图像(Img2Img)管道,使用训练好的 LoRA 权重将个人化主题有选择地插入其中。这一框架隔离了主题编码与整体构图,从而保留了 SDXL 的更广泛生成能力,同时以高保真度方式集成新主题。我们的方法在 SDXL 上实现了 0.789 的 DINO 相似度得分,超越了现有的个人化文本到图像方法。

关键词

引用

@article{arxiv.2505.10743,
  title  = {IMAGE-ALCHEMY: Advancing subject fidelity in personalised text-to-image generation},
  author = {Amritanshu Tiwari and Cherish Puniani and Kaustubh Sharma and Ojasva Nema},
  journal= {arXiv preprint arXiv:2505.10743},
  year   = {2025}
}

备注

8 pages