从多视角学习多物体场景的以物体为中心的表示
计算机视觉与模式识别
2021-11-16 v1 机器学习
摘要
学习多物体场景的以物体为中心的表示是实现机器智能的一种有前景的方法,有助于从视觉感官数据进行高层推理与控制。然而,当前无监督以物体为中心的场景表示方法无法聚合场景的多次观测信息。因此,这些“单视角”方法仅基于单次2D观测(视角)形成其对3D场景的表示。这自然导致若干不准确,使这些方法受制于单视角空间歧义。为此,我们提出多视角多物体网络(MulMON)——一种通过利用多视角来学习多物体场景准确、以物体为中心的表示的方法。为规避多物体-多视角场景的主要技术难点——跨视角保持物体对应——MulMON在多个视角上迭代更新场景的潜在物体表示。为确保这些迭代更新确实聚合空间信息以形成完整的3D场景理解,MulMON在训练中被要求从新视角预测场景外观。通过实验,我们表明MulMON比单视角方法更好地解决了空间歧义——学习到更准确且解耦的物体表示——并实现了预测新视角物体分割的新功能。
引用
@article{arxiv.2111.07117,
title = {Learning Object-Centric Representations of Multi-Object Scenes from Multiple Views},
author = {Li Nanbo and Cian Eastwood and Robert B. Fisher},
journal= {arXiv preprint arXiv:2111.07117},
year = {2021}
}
备注
Accepted at NeurIPS 2020 (Spotlight)