Relationformer:一种用于图像到图生成的统一框架
计算机视觉与模式识别
2022-03-22 v1
摘要
对图像的综合表示需要理解物体及其相互关系,尤其在图像到图生成任务中,例如道路网络提取、血管网络提取或场景图生成。传统上,图像到图生成采用两阶段方法,即先目标检测再进行单独的关系预测,这阻碍了物体与关系的同时交互。本文提出一种基于 transformer 的统一单阶段框架,即 Relationformer,联合预测物体及其关系。我们利用基于直接集合的物体预测,并引入物体间的交互以联合学习物体-关系表示。在现有 [obj]-token 之外,我们提出一种新颖的可学习 token,即 [rln]-token。与 [obj]-token 一起,[rln]-token 通过一系列相互关联在图像中利用局部和全局语义推理。结合成对的 [obj]-token,[rln]-token 有助于实现计算高效的关系预测。我们在多个不同且跨领域的数据集上取得了最先进的性能,证明了我们方法的有效性和泛化能力。
引用
@article{arxiv.2203.10202,
title = {Relationformer: A Unified Framework for Image-to-Graph Generation},
author = {Suprosanna Shit and Rajat Koner and Bastian Wittmann and Johannes Paetzold and Ivan Ezhov and Hongwei Li and Jiazhen Pan and Sahand Sharifzadeh and Georgios Kaissis and Volker Tresp and Bjoern Menze},
journal= {arXiv preprint arXiv:2203.10202},
year = {2022}
}