中文

解决多条件混淆:无需微调的个性化图像生成

计算机视觉与模式识别 2024-12-19 v2

摘要

个性化文本到图像生成方法可基于参考图像生成定制化图像,已引起广泛关注。近期方法提出一种无需测试时微调的解耦式跨注意力机制,以生成无需微调的个性化图像。然而,当提供多个参考图像时,当前的解耦式跨注意力机制会遇到对象混淆问题,无法将每个参考图像映射到其对应的对象,从而严重限制了其应用范围。为解决对象混淆问题,本文研究扩散模型中不同位置潜在图像特征与目标对象的相关性,据此提出加权合并方法将多个参考图像特征合并到对应的对象。随后,我们将该加权合并方法集成到现有的预训练模型中,并在由开源 SA-1B 数据集构建的多对象数据集上继续训练。为缓解对象混淆和减少训练成本,我们提出了对象质量评分,用于选择高质量训练样本。此外,我们的加权合并训练框架可用于单对象生成场景,当单个对象拥有多个参考图像时。实验验证了我们的方法在 Concept101 数据集和 DreamBooth 数据集的多对象个性化图像生成任务上优于现有SOTA方法,并显著提升了单对象个性化图像生成的性能。我们的代码已公开:https://github.com/hqhQAQ/MIP-Adapter。

关键词

引用

@article{arxiv.2409.17920,
  title  = {Resolving Multi-Condition Confusion for Finetuning-Free Personalized Image Generation},
  author = {Qihan Huang and Siming Fu and Jinlong Liu and Hao Jiang and Yipeng Yu and Jie Song},
  journal= {arXiv preprint arXiv:2409.17920},
  year   = {2024}
}