中文

扩散模型中的关系纠正

计算机视觉与模式识别 2024-04-01 v1

摘要

尽管大型文本到图像扩散模型具有卓越的生成能力,但它们(就像熟练但粗心的艺术家一样)常常难以准确描绘对象之间的视觉关系。通过仔细分析,我们发现这个问题源于一个错位的文本编码器,它难以解释特定关系并区分相关对象的逻辑顺序。为了解决这个问题,我们引入了一个名为关系纠正的新任务,旨在改进模型以准确表示其最初未能生成的给定关系。为此,我们提出了一种利用异构图卷积网络的创新解决方案。它对输入提示中关系词和对应对象之间的方向关系进行建模。具体来说,我们在具有相同关系词但对象顺序相反的一对提示上优化HGCN,并辅以少量参考图像。轻量级HGCN调整文本编码器生成的文本嵌入,确保在嵌入空间中准确反映文本关系。关键的是,我们的方法保留了文本编码器和扩散模型的参数,从而保持了模型在无关描述上的稳健性能。我们在一个新整理的不同关系数据集上验证了我们的方法,展示了在生成具有精确视觉关系的图像方面的定量和定性改进。项目页面:https://wuyinwei-hah.github.io/rrnet.github.io/。

关键词

引用

@article{arxiv.2403.20249,
  title  = {Relation Rectification in Diffusion Model},
  author = {Yinwei Wu and Xingyi Yang and Xinchao Wang},
  journal= {arXiv preprint arXiv:2403.20249},
  year   = {2024}
}