通过基于能量的模型实现鲁棒且可控的以对象为中心的学习
机器学习
2022-10-12 v1
摘要
人类在理解和推理复杂视觉场景方面表现出色。将低层观测分解为离散对象的能力使我们能够构建有根据的抽象表示并识别世界的组合结构。因此,机器学习模型能够在没有显式监督的情况下从视觉场景中推断对象及其属性,是一个关键步骤。然而,现有的以对象为中心的表示学习工作要么依赖于定制的神经网络模块,要么依赖于底层生成和推理过程中的强概率假设。在本工作中,我们提出了 \ours,一种概念上简单且通用的方法,通过基于能量的模型来学习以对象为中心的表示。通过使用 Transformer 中现成的标准注意力块构建置换不变的能量函数,我们可以通过基于梯度的 MCMC 方法推断以对象为中心的潜在变量,其中置换等变性得到自动保证。我们表明 \ours 可以轻松集成到现有架构中,并能有效提取高质量的以对象为中心的表示,从而带来更好的分割精度和具竞争力的下游任务性能。此外,实证评估表明 \ours 学习到的表示对分布偏移具有鲁棒性。最后,我们通过重新组合学习到的能量函数用于新场景生成与操控,展示了 \ours 在系统性组合泛化中的有效性。
引用
@article{arxiv.2210.05519,
title = {Robust and Controllable Object-Centric Learning through Energy-based Models},
author = {Ruixiang Zhang and Tong Che and Boris Ivanovic and Renhao Wang and Marco Pavone and Yoshua Bengio and Liam Paull},
journal= {arXiv preprint arXiv:2210.05519},
year = {2022}
}