中文

用于文本驱动图像到图像翻译的条件分数引导

计算机视觉与模式识别 2023-11-21 v3

摘要

我们提出了一种基于预训练文本到图像扩散模型的文本驱动图像到图像翻译新算法。我们的方法旨在通过选择性编辑源图像中由修改文本定义的感兴趣区域来生成目标图像,同时保留其余部分。与仅依赖目标提示的现有技术不同,我们引入了一个新的分数函数,其额外考虑源图像和源文本提示,以适应特定的翻译任务。为此,我们以原则性方式推导条件分数函数,将其分解为标准分数和用于目标图像生成的引导项。对于引导项的梯度计算,我们假设后验分布为高斯分布,并估计其均值和方差以调整梯度而无需额外训练。此外,为提升条件分数引导的质量,我们引入了一种简单而有效的mixup技术,其结合了源自源潜变量和目标潜变量的两个交叉注意力图。该策略可有效促进源图像中不变部分与和目标提示对齐的编辑区域的理想融合,从而实现高保真目标图像生成。通过综合实验,我们证明了我们的方法在各种任务上取得了出色的图像到图像翻译性能。

关键词

引用

@article{arxiv.2305.18007,
  title  = {Conditional Score Guidance for Text-Driven Image-to-Image Translation},
  author = {Hyunsoo Lee and Minsoo Kang and Bohyung Han},
  journal= {arXiv preprint arXiv:2305.18007},
  year   = {2023}
}

备注

Accepted at NeurIPS2023