通过在上下文网络中共享标签实现视觉 - 语义场景理解
计算机视觉与模式识别
2013-09-17 v1 机器学习
机器学习
摘要
我们研究了在包含广泛变化的物体外观和细微差异名称的复杂自然场景中对物体进行命名的问题。受认知研究的启发,我们提出了一种基于在视觉空间和词汇空间之间共享基于上下文的物体假设的方法。为此,我们提出了视觉语义集成模型 (VSIM),该模型将物体标签表示为语义上下文和视觉上下文之间共享的实体,并通过上下文切换更新标签来推断新图像。VSIM 的核心是一个语义 Pachinko 分配模型和一个视觉最近邻潜在狄利克雷分配模型。对于推断过程,我们推导了一种迭代数据增强算法,该算法汇集标签概率并最大化图像的联合标签后验概率。我们的模型在具有挑战性的 SUN09 数据集上的多项视觉任务中超越了最先进方法的性能。
引用
@article{arxiv.1309.3809,
title = {Visual-Semantic Scene Understanding by Sharing Labels in a Context Network},
author = {Ishani Chakraborty and Ahmed Elgammal},
journal= {arXiv preprint arXiv:1309.3809},
year = {2013}
}