中文

StyleTokenizer:通过单例定义图像风格以控制扩散模型

计算机视觉与模式识别 2024-09-05 v1

摘要

尽管许多创新方法涌现用于控制扩散过程,但有效控制文本到图像生成中的图像风格仍然是一个具有挑战性的任务。许多基于适配器的方法在去噪过程中施加图像表示条件来实现图像控制。但这些条件未与词嵌入空间对齐,导致图像和文本控制条件之间的干扰,以及可能丢失文本提示的语义信息。针对这一问题涉及两个关键挑战:首先,如何在不损害文本表示控制效果的前提下注入风格表示;其次,如何从单个参考图像获取准确的风格表示。为解决这些挑战,我们引入StyleTokenizer,一种零样本风格控制图像生成方法,通过风格标记器将风格表示与文本表示对齐。这一对齐有效最小化了对文本提示效果的影响。此外,我们收集了一个标注良好的风格数据集,命名为Style30k,用于训练风格特征提取器,能够准确地表示风格而不包含其他内容信息。实验结果表明,我们的方法完全把握了参考图像的风格特征,在保持目标图像风格和文本提示一致性的同时生成令人愉悦的图像。代码和数据集可在https://github.com/alipay/style-tokenizer 获取。

关键词

引用

@article{arxiv.2409.02543,
  title  = {StyleTokenizer: Defining Image Style by a Single Instance for Controlling Diffusion Models},
  author = {Wen Li and Muyuan Fang and Cheng Zou and Biao Gong and Ruobing Zheng and Meng Wang and Jingdong Chen and Ming Yang},
  journal= {arXiv preprint arXiv:2409.02543},
  year   = {2024}
}

备注

Accepted by ECCV2024