中文

GENESIS-V2:无需迭代精炼推断无序目标表示

计算机视觉与模式识别 2022-01-26 v3 机器学习 机器学习

摘要

无监督目标表示学习的进展催生了多种用于无监督目标分割和可解释以对象为中心的 scene generation 的方法。然而,这些方法局限于视觉复杂度有限的模拟和真实世界数据集。此外,目标表示常使用 RNN 推断,其难以扩展到大型图像,或采用迭代精炼,虽避免了强加不自然的目标顺序,但需要事先初始化固定数量的目标表示。与既有范式不同,本工作提出一种基于嵌入的方法,其中像素的嵌入通过随机 stick-breaking 过程以可微方式进行聚类。与迭代精炼类似,该聚类过程也产生随机排序的目标表示,但无需事先初始化固定数量的簇。据此我们开发了新模型 GENESIS-v2,它可在不使用 RNN 或迭代精炼的情况下推断可变数量的目标表示。我们表明,在已有合成数据集及更复杂的真实世界数据集上,GENESIS-v2 在无监督图像分割和以对象为中心的 scene generation 方面相较近期基线表现强劲。

关键词

引用

@article{arxiv.2104.09958,
  title  = {GENESIS-V2: Inferring Unordered Object Representations without Iterative Refinement},
  author = {Martin Engelcke and Oiwi Parker Jones and Ingmar Posner},
  journal= {arXiv preprint arXiv:2104.09958},
  year   = {2022}
}

备注

NeurIPS 2021 camera-ready version; 26 pages, 19 figures