中文

DreamMatcher:用于语义一致文本到图像个性化的外观匹配自注意力机制

计算机视觉与模式识别 2024-04-24 v2

摘要

文本到图像(T2I)个性化的目标是将扩散模型定制适应用户提供的参考概念,生成与目标提示对齐的该概念的多样化图像。使用独特文本嵌入来表示参考概念的传统方法往往无法准确模仿参考的外观。为解决这一问题,一种解决方案可能是将参考图像显式地条件化到目标去噪过程中,即所谓的键值替换。然而,先前的工作受限于局部编辑,因为它们破坏了预训练 T2I 模型的结构路径。为克服这一限制,我们提出了一种名为 DreamMatcher 的新型插件方法,该方法将 T2I 个性化重新表述为语义匹配。具体而言,DreamMatcher 用经语义匹配对齐的参考值替换目标值,同时保持结构路径不变,以保留预训练 T2I 模型生成多样化结构的通用能力。我们还引入了一种语义一致掩码策略,以将个性化概念与目标引入的无关区域隔离开来。DreamMatcher 与现有 T2I 模型兼容,在复杂场景中显示出显著改进。深入分析证明了该方法的有效性。

关键词

引用

@article{arxiv.2402.09812,
  title  = {DreamMatcher: Appearance Matching Self-Attention for Semantically-Consistent Text-to-Image Personalization},
  author = {Jisu Nam and Heesu Kim and DongJae Lee and Siyoon Jin and Seungryong Kim and Seunggyu Chang},
  journal= {arXiv preprint arXiv:2402.09812},
  year   = {2024}
}

备注

Project page is available at https://ku-cvlab.github.io/DreamMatcher/