中文

通过可解释潜空间操控提升条件图像生成

计算机视觉与模式识别 2024-08-30 v1 人工智能 机器学习

摘要

在图像合成领域,实现对参考图像的忠实呈现同时遵循条件提示 remains 挑战。本文提出一种新方法,将扩散模型与潜空间操控和基于梯度的选择性注意力机制相结合,以解决此问题。利用 Grad-SAM(梯度基于选择性注意力操控),我们分析交叉注意力层的交叉注意力图和去噪潜向量的梯度,推导出与感兴趣主题相关的去噪潜向量元素重要性得分。基于此信息,我们在去噪过程中特定时间步创建掩码,以保留主题 while 无缝整合参考图像特征。该方法确保基于条件提示的主题忠实形成,同时对背景进行细化以实现更一致的构图。我们在 places365 数据集上进行实验,结果表明,我们的模型在保持忠实性方面表现优异,实现的最低均值和中位数 FID 分数优于基线模型,表明保真度卓越。此外,我们的模型在将生成图像与提供文本描述对齐方面表现出竞争力,证据是高 CLIP 分数。这些结果凸显了我们方法在忠实性保持和文本语境保持方面的有效性,为文本到图像合成任务带来了重要进展。

关键词

引用

@article{arxiv.2408.16232,
  title  = {Enhancing Conditional Image Generation with Explainable Latent Space Manipulation},
  author = {Kshitij Pathania},
  journal= {arXiv preprint arXiv:2408.16232},
  year   = {2024}
}

备注

7 pages , 5 figures