中文

MagicTailor: 文本到图像扩散模型中的组件可控个性化

计算机视觉与模式识别 2025-05-22 v3 人工智能

摘要

文本到图像扩散模型可以生成高质量的图像,但缺乏对视觉概念的细粒度控制,限制了其创造力。因此,我们引入了组件可控个性化这一新任务,使用户能够定制和重新配置概念中的各个组件。该任务面临两个挑战:语义污染,即不需要的元素干扰目标概念;以及语义不平衡,导致对目标概念和组件的学习不成比例。为了解决这些问题,我们设计了MagicTailor框架,该框架使用动态掩码退化来自适应地扰动不需要的视觉语义,并使用双流平衡来实现对所需视觉语义的更平衡学习。实验结果表明,MagicTailor在该任务中实现了优越的性能,并实现了更加个性化和创造性的图像生成。

关键词

引用

@article{arxiv.2410.13370,
  title  = {MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models},
  author = {Donghao Zhou and Jiancheng Huang and Jinbin Bai and Jiaze Wang and Hao Chen and Guangyong Chen and Xiaowei Hu and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2410.13370},
  year   = {2025}
}

备注

Accepted by IJCAI2025 (Project page: https://correr-zhou.github.io/MagicTailor)