中文

物体场景表示变换器

计算机视觉与模式识别 2022-10-13 v2 人工智能 机器学习

摘要

以物体及其在三维空间中的几何形式对世界进行组合式理解被视为人类认知的基石。促进神经网络学习此类表示有望大幅提升标注数据效率。作为朝此方向的关键一步,我们在以无监督方式学习将复杂场景按三维一致性分解为单个物体这一问题上取得进展。我们提出物体场景表示变换器(OSRT),一种以三维为中心的模型,其中单个物体表示通过新颖视图合成自然浮现。OSRT可扩展到比现有方法复杂得多、物体与背景多样性大得多的场景。同时,得益于其光场参数化与新颖的槽混合解码器,它在组合式渲染上快数个数量级。我们相信本工作不仅将加速未来的架构探索与扩展努力,也将作为物体中心及神经场景表示学习社区的有用工具。

关键词

引用

@article{arxiv.2206.06922,
  title  = {Object Scene Representation Transformer},
  author = {Mehdi S. M. Sajjadi and Daniel Duckworth and Aravindh Mahendran and Sjoerd van Steenkiste and Filip Pavetić and Mario Lučić and Leonidas J. Guibas and Klaus Greff and Thomas Kipf},
  journal= {arXiv preprint arXiv:2206.06922},
  year   = {2022}
}

备注

Accepted at NeurIPS '22. Project page: https://osrt-paper.github.io/