全卷积场景图生成
计算机视觉与模式识别
2021-03-31 v1
摘要
本文提出一种全卷积场景图生成(FCSGG)模型,可同时检测对象与关系。大多数场景图生成框架使用预训练的两阶段对象检测器(如 Faster R-CNN),并基于边界框特征构建场景图。此类流程通常参数量大且推理速度低。不同于这些方法,FCSGG 是一种概念上简洁高效的自底向上方法,将对象编码为边界框中心点,将关系编码为称为关系亲和场(RAF)的 2D 向量场。RAF 编码语义与空间特征,并通过从主体指向对象的子区域上的积分显式表示一对对象间的关系。FCSGG 仅利用视觉特征,仍生成强力的场景图生成结果。在 Visual Genome 数据集上的综合实验证明了所提方法的有效性、高效性与泛化能力。FCSGG 在召回率与零样本召回率上取得极具竞争力的结果,且推理时间显著减少。
引用
@article{arxiv.2103.16083,
title = {Fully Convolutional Scene Graph Generation},
author = {Hengyue Liu and Ning Yan and Masood S. Mortazavi and Bir Bhanu},
journal= {arXiv preprint arXiv:2103.16083},
year = {2021}
}
备注
CVPR 2021 Oral