用于图像到场景图映射的注意力关系网络
计算机视觉与模式识别
2019-04-09 v2
摘要
场景图生成是指将图像自动映射为语义结构图的任务,这需要正确标注每个提取出的对象及其交互关系。尽管基于深度学习的物体检测技术近期取得了成功,但从视觉数据中推断复杂的上下文关系与结构化图表示仍是一个具有挑战性的课题。在本研究中,我们提出了一种新颖的注意力关系网络(Attentive Relational Network),该网络以物体检测骨干网络为基础,包含两个关键模块来解决此问题。第一个模块是语义变换模块,用于将视觉特征与语言特征转换到一个共同的语义空间中,以捕获语义嵌入的关系特征。另一个模块是图自注意力模块,通过为相邻节点分配不同的重要性权重来嵌入联合图表示。最后,关系推断模块生成准确的场景图以识别所有实体及相应关系。我们在广泛采用的 Visual Genome Dataset 上评估了所提出的方法,结果证明了我们模型的有效性与优越性。
引用
@article{arxiv.1811.10696,
title = {Attentive Relational Networks for Mapping Images to Scene Graphs},
author = {Mengshi Qi and Weijian Li and Zhengyuan Yang and Yunhong Wang and Jiebo Luo},
journal= {arXiv preprint arXiv:1811.10696},
year = {2019}
}
备注
Accepted by CVPR 2019