基于扩散模型与掩码对比预训练的场景图到图像生成
计算机视觉与模式识别
2022-11-22 v1
摘要
从场景图等图结构输入生成图像具有独特的挑战性,因为难以将图中的节点与连接同图像中的物体及其关系对齐。现有多数方法通过使用场景布局来解决这一挑战,场景布局是场景图的图像式表示,旨在捕捉场景图像的粗略结构。由于场景布局是人工设计的,其与图像的对齐可能未得到充分优化,导致生成图像与原始场景图之间的符合性欠佳。为解决此问题,我们提出通过直接优化场景图嵌入与图像的对齐来学习场景图嵌入。具体而言,我们预训练一个编码器,从场景图中提取可预测对应图像的全局与局部信息,依赖于两个损失函数:掩码自编码损失与对比损失。前者通过重建随机掩码的图像区域来训练嵌入,后者则根据场景图训练嵌入以区分符合与不符合的图像。给定这些嵌入,我们构建了一个潜在扩散模型,从场景图生成图像。所得方法称为 SGDiff,可通过修改场景图节点与连接实现对生成图像的语义操控。在 Visual Genome 与 COCO-Stuff 数据集上,我们证明 SGDiff 优于 state-of-the-art 方法,以 Inception Score 与 Fréchet Inception Distance (FID) 指标衡量。我们将在 https://github.com/YangLing0818/SGDiff 发布源代码与训练模型。
引用
@article{arxiv.2211.11138,
title = {Diffusion-Based Scene Graph to Image Generation with Masked Contrastive Pre-Training},
author = {Ling Yang and Zhilin Huang and Yang Song and Shenda Hong and Guohao Li and Wentao Zhang and Bin Cui and Bernard Ghanem and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2211.11138},
year = {2022}
}
备注
Code and models shall be released at https://github.com/YangLing0818/SGDiff