用于场景生成的组合式 Transformer
计算机视觉与模式识别
2021-11-18 v1 人工智能
机器学习
摘要
我们引入了 GANformer2 模型,一种迭代的面向对象 transformer,探索用于生成建模任务。该网络融入了强而明确的结构先验,以反映视觉场景的组合性质,并通过顺序过程合成图像。它分两个阶段运行:一个快速轻量的规划阶段,我们起草高层场景布局;随后是基于注意力的执行阶段,布局被精炼,演化为丰富而细致的图像。我们的模型脱离了具有扁平且整体式潜空间的常规黑盒 GAN 架构,转向鼓励高效性、可控性和可解释性的透明设计。我们通过对一系列数据集(从多对象 CLEVR 场景到具挑战性的 COCO 图像)的细致评估展示了 GANformer2 的优势与特性,表明其在视觉质量、多样性和一致性方面成功达到了最先进水平(state-of-the-art, SOTA)。进一步实验证明了模型的解耦能力,并更深入地洞察其生成过程:从粗糙的初始草图,到考虑对象深度与依赖关系的详细布局,直至最终高分辨率描绘生动而复杂的真实场景。模型实现见 https://github.com/dorarad/gansformer。
引用
@article{arxiv.2111.08960,
title = {Compositional Transformers for Scene Generation},
author = {Drew A. Hudson and C. Lawrence Zitnick},
journal= {arXiv preprint arXiv:2111.08960},
year = {2021}
}
备注
Published as a conference paper at NeurIPS 2021