中文

Instruct-CLIP:利用对比学习实现指令引导图像编辑自动数据细化

计算机视觉与模式识别 2025-03-25 v1 机器学习

摘要

虽然自然语言指令为引导自动图像编辑提供了直观的方式,但深度学习模型往往难以实现高质�结果,主要源于创建大量高质量训练数据集的困难。为此,先前方法通常依赖文本到图像(T2I)生成模型产生原始图像与编辑后图像的配对,以模拟指令引导图像编辑模型的输入/输出。然而,这些图像配对常因 T2I 模型的局限性而与指定的编辑指令不符,这会严重影响在此类数据集上训练的模型。为此,我们提出 Instruct-CLIP(I-CLIP),一种自监督方法,学习原始图像与编辑后图像之间的语义变化,以细化和更好地对齐现有数据集中的指令。此外,我们将 Instruct-CLIP 适用于处理噪声潜在图像和扩散时间步,从而可用于训练潜在扩散模型(LDM),在扩散管道的任何步骤中都能通过潜在空间强制执行指令与图像变化之间的对齐。我们使用 Instruct-CLIP 更正 InstructPix2Pix 数据集,获得超过 12 万个细化样本,然后我们基于我们新颖的 I-CLIP 损失函数对其进行微调。 resulting 的模型能够产生更符合给定指令的编辑结果。我们的代码和数据集已在 https://github.com/SherryXTChen/Instruct-CLIP.git 上提供。

关键词

引用

@article{arxiv.2503.18405,
  title  = {Offline Meteorology-Pollution Coupling Global Air Pollution Forecasting Model with Bilinear Pooling},
  author = {Xu Fan and Yuetan Lin and Bing Gong and Hao Li},
  journal= {arXiv preprint arXiv:2503.18405},
  year   = {2025}
}