用于场景图到图像生成的规范表示学习
计算机视觉与模式识别
2020-08-25 v5
摘要
当希望控制生成图像的结构时,生成复杂视觉场景的真实图像变得具有挑战性。先前的方法表明,具有少量实体的场景可使用场景图进行控制,但随着图复杂度(对象和边的数量)增加,该方法表现不佳。在这项工作中,我们指出当前方法的一个局限是它们无法捕捉图中的语义等价性。我们提出了一种新颖模型,通过从数据中学习规范图表示来解决这些问题,从而改善复杂视觉场景的图像生成。我们的模型在大型场景图上展现出改进的经验性能、对输入场景图中噪声的鲁棒性,以及对语义等价图的泛化能力。最后,我们展示了该模型在三个不同基准上的改进性能:Visual Genome、COCO和CLEVR。
引用
@article{arxiv.1912.07414,
title = {Learning Canonical Representations for Scene Graph to Image Generation},
author = {Roei Herzig and Amir Bar and Huijuan Xu and Gal Chechik and Trevor Darrell and Amir Globerson},
journal= {arXiv preprint arXiv:1912.07414},
year = {2020}
}
备注
ECCV 2020