中文

Control-CLIP:在 CLIP 中解耦特定领域的类别与风格引导

计算机视觉与模式识别 2025-02-18 v1

摘要

文本到图像扩散模型在生成高度质量且紧贴文本输入的图像方面显示出惊人的能力。然而,文本引导的有效性严重依赖于 CLIP 文本编码器,而该编码器被训练用于关注通用内容,却难以捕捉特定领域(如风格)的语义。因此,仅凭简单地生成“一张猫的照片”就无法实现对“猫的 Pokémon 风格照片”这类提示的有效生成。为填补这一空白,我们提出了 Control-CLIP,一种新的解耦式 CLIP 微调框架,使 CLIP 模型能够以互补的方式学习类别和风格的含义。通过在最小数据上进行专门设计的微调任务和修改的注意力机制,Control-CLIP 能精确地引导扩散模型指向特定领域。此外,扩散模型的参数保持不变,保留了原始的生成性能和多样性。跨多个领域的实验确认了本方法的有效性,尤其突出了其在生成带有各种特定风格内容时的稳健即插即用能力。

关键词

引用

@article{arxiv.2502.11532,
  title  = {Control-CLIP: Decoupling Category and Style Guidance in CLIP for Specific-Domain Generation},
  author = {Zexi Jia and Chuanwei Huang and Hongyan Fei and Yeshuang Zhu and Zhiqiang Yuan and Jinchao Zhang and Jie Zhou},
  journal= {arXiv preprint arXiv:2502.11532},
  year   = {2025}
}