CLIP 模型暗藏图像到提示词的转换器功能
计算机视觉与模式识别
2024-02-16 v2
摘要
Stable Diffusion 模型是一种著名的文本到图像生成模型,它依赖文本提示词作为输入,并使用对比语言-图像预训练(CLIP)进行编码。然而,在融入参考图像中的隐式信息方面,文本提示词存在局限性。现有方法试图通过采用涉及数百万训练样本的图像到图像生成的昂贵训练流程来解决这一局限。相比之下,本文证明 Stable Diffusion 中使用的 CLIP 模型本身即具备将图像即时转换为文本提示词的能力。这种图像到提示词的转换可通过使用以闭式解计算的线性投影矩阵来实现。此外,本文展示了该能力可进一步通过利用少量同领域训练数据(约 100 张图像)或在参考图像上加入若干在线训练步(约 30 次迭代)来增强。借助这些方法,所提方法提供了一种简单而灵活的方案来弥合图像与文本提示词之间的鸿沟。该方法可应用于图像变体和图像编辑等多种任务,促进图像与文本提示词之间更有效和无缝的交互。
引用
@article{arxiv.2305.12716,
title = {The CLIP Model is Secretly an Image-to-Prompt Converter},
author = {Yuxuan Ding and Chunna Tian and Haoxuan Ding and Lingqiao Liu},
journal= {arXiv preprint arXiv:2305.12716},
year = {2024}
}
备注
Accepted by NeurIPS 2023, 21 pages, 28 figures