神经基序:基于全局上下文的场景图解析
计算机视觉与模式识别
2018-03-30 v2
摘要
我们研究了生成视觉场景结构化图表示的问题。我们的工作分析了基序(motif)的作用:即场景图中规律出现的子结构。我们针对 Visual Genome 数据集中此类重复结构给出了新的定量见解。我们的分析表明,对象标签对关系标签具有高度预测性,反之则不然。我们还发现,即使在更大的子图中也存在重复模式:超过 50% 的图包含涉及至少两个关系的基序。我们的分析促成了一种新的基线:在给定对象检测的情况下,预测训练集中所见具有给定标签的对象对之间最频繁的关系。该基线在不同评估设置下平均相对改进了 3.6%,优于先前的最优(state-of-the-art)方法。随后我们引入了堆叠基序网络(Stacked Motif Networks),这是一种旨在捕捉场景图中高阶基序的新架构,相较我们强基线进一步平均相对提升 7.1%。我们的代码可在 github.com/rowanz/neural-motifs 获取。
引用
@article{arxiv.1711.06640,
title = {Neural Motifs: Scene Graph Parsing with Global Context},
author = {Rowan Zellers and Mark Yatskar and Sam Thomson and Yejin Choi},
journal= {arXiv preprint arXiv:1711.06640},
year = {2018}
}
备注
CVPR 2018 camera ready