中文

用于视觉关系与属性检测的深度变分结构强化学习

计算机视觉与模式识别 2017-03-10 v1 人工智能 机器学习

摘要

尽管在图像分类和检测等视觉感知任务中取得了进展,但计算机仍然难以从整体上理解场景中对象的相互依赖关系,例如对象之间的关系或其属性。现有方法通常忽略捕获不同对象实例之间交互的全局上下文线索,并且只能通过为所有可能的关系穷举地训练单独的检测器来识别少数类型。为了捕获这种全局相互依赖关系,我们提出了一种深度变分结构强化学习(VRL)框架,以在整幅图像中顺序发现对象关系和属性。首先,利用语言先验构建有向语义动作图,以提供对象类别、谓词和属性之间语义相关性的丰富紧凑表示。接下来,我们在动作图上使用变分结构遍历,基于当前状态和历史动作为每一步构建一个小巧的自适应动作集。特别地,我们使用一种感知模糊性的对象挖掘方案来解决目标检测器无法区分的对象类别之间的语义模糊性。然后,我们使用深度强化学习框架进行顺序预测,并将全局上下文线索和先前提取短语的语义嵌入纳入状态向量中。我们在视觉关系检测(VRD)数据集和大规模Visual Genome数据集上的实验验证了VRL的优越性,它可以在涉及数千种关系和属性类型的数据集上取得显著更好的检测结果。我们还证明,VRL能够通过学习共享图节点上的相关性来预测嵌入我们动作图中的未见类型。

关键词

引用

@article{arxiv.1703.03054,
  title  = {Deep Variation-structured Reinforcement Learning for Visual Relationship and Attribute Detection},
  author = {Xiaodan Liang and Lisa Lee and Eric P. Xing},
  journal= {arXiv preprint arXiv:1703.03054},
  year   = {2017}
}

备注

This manuscript is accepted by CVPR 2017 as a spotlight paper