中文

任意创造:面向多主体的布局可控个性化扩散模型

计算机视觉与模式识别 2025-05-28 v1

摘要

扩散模型显著推进了文本到图像生成,为个性化生成框架的发展奠定了基础。然而,现有方法缺乏精确的布局可控性,且忽略了参考主体的动态特征在提升保真度方面的潜力。在本工作中,我们提出了布局可控个性化扩散(LCP-Diffusion)模型,这是一种以无调优方式将主体身份保持与灵活布局指导相结合的新型框架。我们的模型采用动静互补视觉精炼模块来全面捕获参考主体的复杂细节,并引入双重布局控制机制,在训练和推理阶段均强制执行稳健的空间控制。大量实验验证了 LCP-Diffusion 在身份保持和布局可控性方面均表现卓越。据我们所知,这是一项使用户能够“任意创造”的开创性工作。

关键词

引用

@article{arxiv.2505.20909,
  title  = {Create Anything Anywhere: Layout-Controllable Personalized Diffusion Model for Multiple Subjects},
  author = {Wei Li and Hebei Li and Yansong Peng and Siying Wu and Yueyi Zhang and Xiaoyan Sun},
  journal= {arXiv preprint arXiv:2505.20909},
  year   = {2025}
}

备注

ICME 2025