中文

DRC:通过解缠表示合成增强个性化图像生成

计算机视觉与模式识别 2025-08-05 v2 信息检索

摘要

个性化图像生成已成为多模态内容创建中的热门方向。其旨在通过利用用户交互历史图像和多模态指令,合成针对个人风格偏好(如配色方案、角色外观、布局)和语义意图(如情感、动作、场景上下文)定制的图像。尽管取得了显著进展,但现有方法——无论基于扩散模型、大语言模型还是大型多模态模型(LMM)——都难以准确捕获和融合用户风格偏好与语义意图。特别是,领先的LMM方法因视觉特征的缠合导致引导崩溃,生成的图像无法保留用户偏好的风格或反映指定的语义。为解决这些限制,我们提出DRC(Disentangled Representation Composition,即解缠表示合成),这是一种新的个性化图像生成框架,通过解缠表示合成来增强LMM。DRC从历史图像和参考图像中显式提取用户风格偏好和语义意图,形成针对性的潜在指令,以指导LMM内的图像生成。具体而言,它涉及两个关键学习阶段:1)解缠学习,通过基于难度感知重要性抽样的重建驱动范式,使用双塔解缠器显式分离风格和语义特征;2)个性化建模,通过语义保持数据增强有效地适应解缠表示,以实现稳健的个性化生成。大量实验表明,DRC在两个基准数据集上表现竞争力,有效缓解了引导崩溃问题,凸显了解缠表示学习在可控且有效的个性化图像生成中的重要性。

关键词

引用

@article{arxiv.2504.17349,
  title  = {DRC: Enhancing Personalized Image Generation via Disentangled Representation Composition},
  author = {Yiyan Xu and Wuqiang Zheng and Wenjie Wang and Fengbin Zhu and Xinting Hu and Yang Zhang and Fuli Feng and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2504.17349},
  year   = {2025}
}

备注

Accepted for publication in ACM MM'25