用于视觉关系检测的上下文相关扩散网络
计算机视觉与模式识别
2018-09-18 v1 计算与语言
机器学习
机器学习
摘要
视觉关系检测可弥合计算机视觉与自然语言之间的鸿沟以实现图像的场景理解。与纯物体识别任务不同,主体-谓词-客体的关系三元组处于极度多样的空间中,例如 person-behind-person 和 car-behind-building,同时遭受组合爆炸问题。本文提出一种上下文相关扩散网络(CDDN)框架来处理视觉关系检测。为捕获不同物体实例间的交互,构建了两类图——词语语义图和视觉场景图——以编码全局上下文相互依赖。语义图通过语言先验构建以建模跨物体的语义关联,而视觉场景图定义了场景物体的连接从而利用周围场景信息。针对图结构数据,我们设计了一种扩散网络以自适应地从上下文聚合信息,其能有效学习视觉关系的潜在表示,并因其对图的同构不变性而很好地契合视觉关系检测。在两个广泛使用的数据集上的实验表明,我们所提方法更有效并达到了最先进(SOTA)性能。
引用
@article{arxiv.1809.06213,
title = {Context-Dependent Diffusion Network for Visual Relationship Detection},
author = {Zhen Cui and Chunyan Xu and Wenming Zheng and Jian Yang},
journal= {arXiv preprint arXiv:1809.06213},
year = {2018}
}
备注
8 pages, 3 figures, 2018 ACM Multimedia Conference (MM'18)