中文

基于对比学习引导的潜在扩散模型图像到图像翻译

计算机视觉与模式识别 2025-03-27 v1 人工智能

摘要

扩散模型在文本引导的图像翻译中展现了优异的性能。然而,在文本提示的形式化和参考图像内容的保持方面仍有提升空间。首先,目标文本提示的差异会显著影响生成图像的质量,用户往往难以精准地编写能够充分捕获输入图像内容的优化提示。其次,虽然现有模型可引入对特定区域的期望修改,但经常会导致应保持不变的区域产生意外更改。为此,我们提出了 pix2pix-zeroCon,这是一种零样本基于扩散的方法,通过利用 patch-wise 对比损失消除额外训练的需求。具体地,我们基于参考图像和目标提示自动确定文本嵌入空间中的编辑方向。此外,为确保编辑后图像中内容和结构的精确保持,我们引入了跨注意力引导损失和生成图像与原始图像嵌入之间基于 patch-wise 的对比损失。值得注意的是,我们的方法无需额外训练,直接作用于预训练的文本到图像扩散模型。广泛的实验表明,我们的方法在图像到图像翻译中优于现有模型,实现了增强的保真度和可控性。

关键词

引用

@article{arxiv.2503.20484,
  title  = {Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation},
  author = {Qi Si and Bo Wang and Zhao Zhang},
  journal= {arXiv preprint arXiv:2503.20484},
  year   = {2025}
}

备注

11 pages, 13 figures