中文

基于自适应文本-图像协调的新颖物体合成

计算机视觉与模式识别 2024-10-29 v1

摘要

本文研究一项物体合成任务,即将物体文本与物体图像结合以生成新的物体图像。然而,大多数扩散模型在此任务上存在困难,即由于文本与图像输入之间的不平衡,生成的物体往往主要反映文本或图像之一。为解决此问题,我们提出了一种简单而有效的方法,称为自适应文本-图像协调(ATIH),以生成新颖且令人惊奇的物体。首先,我们在文本-图像反演扩散过程中,引入一个缩放因子和一个注入步长,分别用于平衡交叉注意力中的文本与图像特征,并在自注意力中保留图像信息。其次,为了更好地融合物体文本与图像,我们设计了一个带有噪声参数的平衡损失函数,确保物体图像的最佳可编辑性与保真度。第三,为了自适应地调整这些参数,我们提出了一种新颖的相似度评分函数,它不仅最大化生成物体图像与输入文本/图像之间的相似度,还平衡这些相似度以协调文本与图像的融合。大量实验证明了我们方法的有效性,展示了如疣猴-玻璃罐等非凡的物体创作。项目页面:https://xzr52.github.io/ATIH/。

关键词

引用

@article{arxiv.2410.20823,
  title  = {Novel Object Synthesis via Adaptive Text-Image Harmony},
  author = {Zeren Xiong and Zedong Zhang and Zikun Chen and Shuo Chen and Xiang Li and Gan Sun and Jian Yang and Jun Li},
  journal= {arXiv preprint arXiv:2410.20823},
  year   = {2024}
}

备注

NeurIPS2024