中文

场景:一种用于复杂场景理解的新表示

计算机视觉与模式识别 2018-02-20 v1

摘要

计算智能体对真实世界场景图像的高层内容进行推理的能力对许多应用十分重要。现有解决复杂场景理解问题的尝试缺乏表示能力、效率,以及创建关于场景的鲁棒元知识的能力。本文中,我们引入场景(scenarios)作为一种表示场景的新方式。场景是一种简单、低维、数据驱动的表示,由频繁共现的物体集合构成,可用于广泛的场景理解任务。我们使用一种新颖的矩阵分解方法从数据中学习场景,并将其集成到新的神经网络架构ScenarioNet中。利用ScenarioNet,我们可在三个粒度层级上恢复真实世界场景图像的语义信息:1)场景类别,2)场景,3)物体。训练单一的ScenarioNet模型使我们能够执行场景分类、场景识别、多物体识别、基于内容的场景图像检索以及基于内容的图像比较。除了在单一统一框架中解决许多任务外,ScenarioNet比其他CNN更高效,因为它所需参数显著更少,同时在基准任务上取得相似性能;并且更具可解释性,因为它在决策时给出解释。我们在多个基准数据集上的多样化场景理解任务中验证了场景与ScenarioNet的效用。

关键词

引用

@article{arxiv.1802.06117,
  title  = {Scenarios: A New Representation for Complex Scene Understanding},
  author = {Zachary A. Daniels and Dimitris N. Metaxas},
  journal= {arXiv preprint arXiv:1802.06117},
  year   = {2018}
}