中文

从视觉场景学习物理图表示

计算机视觉与模式识别 2020-06-25 v2 机器学习

摘要

卷积神经网络(CNNs)已在视觉对象分类的表示学习方面表现出色。然而,CNNs 并未显式编码对象、部件及其物理属性,这限制了 CNNs 在需要视觉场景结构化理解的任务上的成功。为克服这些局限,我们提出物理场景图(PSGs)的概念,其将场景表示为层次图,层次中的节点直观对应于不同尺度的对象部件,边对应于部件间的物理连接。每个节点绑定一个潜属性向量,直观表示表面形状与纹理等对象属性。我们还描述了 PSGNet,一种通过 PSG 结构化瓶颈重构场景来学习提取 PSGs 的网络架构。PSGNet 通过以下方式增强标准 CNNs:循环反馈连接以结合低层与高层图像信息;图池化与向量化操作将空间均匀特征图转换为以对象为中心的图结构;以及感知分组原则以鼓励识别有意义的场景元素。我们表明,PSGNet 在场景分割任务上优于其他自监督场景表示算法,尤其在复杂真实图像上,并对未见对象类型与场景排列具有良好的泛化能力。PSGNet 还能从物理运动中学习,即使对静态图像也能增强场景估计。我们给出了一系列消融研究以阐明 PSGNet 架构各组件的重要性,分析显示所学潜属性捕获了直观的场景性质,并展示了 PSGs 在组合式场景推断中的用途。

关键词

引用

@article{arxiv.2006.12373,
  title  = {Learning Physical Graph Representations from Visual Scenes},
  author = {Daniel M. Bear and Chaofei Fan and Damian Mrowca and Yunzhu Li and Seth Alter and Aran Nayebi and Jeremy Schwartz and Li Fei-Fei and Jiajun Wu and Joshua B. Tenenbaum and Daniel L. K. Yamins},
  journal= {arXiv preprint arXiv:2006.12373},
  year   = {2020}
}

备注

23 pages; corrected affiliations and acknowledgments