中文

从场景图变换生成图像

计算机视觉与模式识别 2022-07-04 v1

摘要

从语义视觉知识生成图像是一项具有挑战性的任务,与类标签或文本描述等替代方案相比,它能够以复杂、细致且无歧义的方式条件化合成过程。尽管存在由语义表示条件化的生成方法,但它们除了指定物体间约束外,不提供控制生成过程的方式。例如,通过手动添加特定条目迭代生成或修改图像的可能性是一个期望的特性,据我们所知,文献中尚未充分研究。本工作中我们提出一种由场景图条件化的基于 transformer 的方法,与近期基于 transformer 的方法相反,它还采用一个解码器自回归地组合图像,使合成过程更有效且可控。所提架构由三个模块组成:1) 图卷积网络,用于编码输入图的关系;2) 编码器-解码器 transformer,自回归地组合输出图像;3) 自动编码器,用于生成作为 transformer 每步生成输入/输出的表示。在 CIFAR10 和 MNIST 图像上获得的结果表明,我们的模型能够满足场景图定义的语义约束,并在考虑用户提供的目标部分渲染的情况下对场景中视觉物体间的关系建模。

关键词

引用

@article{arxiv.2207.00545,
  title  = {Transforming Image Generation from Scene Graphs},
  author = {Renato Sortino and Simone Palazzo and Concetto Spampinato},
  journal= {arXiv preprint arXiv:2207.00545},
  year   = {2022}
}