基于视觉-语言消息传递在自然图像上定位场景图
计算机视觉与模式识别
2022-11-04 v1 人工智能
摘要
本文提出了一个框架,用于联合定位遵循场景图中给定语义关系约束的物体。典型的自然场景包含多个物体,它们之间常表现出不同复杂度的视觉关系。与传统仅基于物体查询的定位任务相比,这些物体间关系为提升定位性能提供了强有力的上下文线索。场景图是一种高效且结构化的方式,用于表示图像中的所有物体及其语义关系。为桥接这两种表示场景的模态并利用上下文信息改进物体定位,我们严谨地研究了在自然图像上定位场景图的问题。为此,我们提出了一种基于图神经网络的新方法,称为视觉-语言消息传递图神经网络(VL-MPAG Net)。在 VL-MPAG Net 中,我们首先以物体候选框为节点构建有向图,节点对之间的边表示它们之间可能存在的关联。随后执行三步图间与图内消息传递,以学习候选框与查询物体的上下文相关表示。这些物体表示被用于为候选框打分以生成物体定位。所提方法在四个公开数据集上显著优于基线方法。
引用
@article{arxiv.2211.01969,
title = {Grounding Scene Graphs on Natural Images via Visio-Lingual Message Passing},
author = {Aditay Tripathi and Anand Mishra and Anirban Chakraborty},
journal= {arXiv preprint arXiv:2211.01969},
year = {2022}
}