中文

定制化生成再构想:保真度与可编辑性的和谐统一

计算机视觉与模式识别 2024-12-09 v1

摘要

定制化生成旨在将新概念融入预训练文本到图像模型中,使其能够在文本提示引导下在新语境中生成该概念的新实例。然而,定制化生成存在保真度与可编辑性之间的固有权衡,即精确建模概念与忠实遵循提示之间的矛盾。先前的做法无奈地寻求折中,难以同时实现高概念保真度和理想的提示对齐。在本文中,我们提出了分而治之、再整合(DCI)框架,该框架在去噪早期阶段进行手术式调整,使微调模型在推理时摆脱保真度-可编辑性权衡。权衡中的两个冲突组件被解耦并由两个协作分支分别攻克,然后被选择性整合以在保持高概念保真度的同时实现忠实提示遵循。为了获得更好的微调模型,我们提出了图像特定上下文优化(ICO)策略用于模型定制。ICO用可学习的图像特定上下文替代手动提示模板,提供自适应且精确的微调方向以促进整体性能。大量实验证明了我们方法在调和保真度-可编辑性权衡方面的有效性。

关键词

引用

@article{arxiv.2412.04831,
  title  = {Customized Generation Reimagined: Fidelity and Editability Harmonized},
  author = {Jian Jin and Yang Shen and Zhenyong Fu and Jian Yang},
  journal= {arXiv preprint arXiv:2412.04831},
  year   = {2024}
}

备注

18 pages, 12 figures, ECCV 2024