使用卷积神经网络识别图像中的空间关系
人工智能
2017-06-15 v1 计算机视觉与模式识别
神经与进化计算
摘要
构建大规模知识图谱的传统方法通常依赖于从非结构化文本(例如 Dbpedia)中提取信息(实体、其属性及它们之间的关系)。卷积神经网络(CNN)的最新进展使我们能够将焦点转移到从图像中学习实体和关系,因为它们构建的鲁棒模型几乎不需要对图像进行预处理。在本文中,我们提出了一种使用 CNN 从图像中识别和提取空间关系(例如,女孩站在桌子后面)的方法。我们的研究解决了两个具体挑战:深入了解网络如何学习空间关系以及图像的哪些部分被用于预测这些关系。我们使用预训练网络 VGGNet 从图像中提取特征,并在一组合成图像和 sun09 数据集上训练多层感知机(MLP)以提取空间关系。该 MLP 在没有围绕物体或图像中描绘关系的空间绘制边界框的情况下预测空间关系。为了理解空间关系如何在网络中表示,在图像上叠加热图以显示网络认为重要的区域。此外,我们分析了 MLP 以展示一致节点组的激活与空间关系预测之间的关系。我们展示了这些节点组的损失如何影响网络识别关系的能力。
引用
@article{arxiv.1706.04215,
title = {Identifying Spatial Relations in Images using Convolutional Neural Networks},
author = {Mandar Haldekar and Ashwinkumar Ganesan and Tim Oates},
journal= {arXiv preprint arXiv:1706.04215},
year = {2017}
}