中文

生成式学习可微对象模型用于复杂场景的组合解释

计算机视觉与模式识别 2025-06-11 v1

摘要

本研究基于 Disentangler of Visual Priors (DVP) 的架构进行扩展,该架构是一种自编码器,能够通过将感知到的物体分解为独立的形状、大小、方向和颜色外观等视觉属性来解释场景。这些属性以潜在参数形式表达,控制一个可微分渲染器进行图像重构,从而使模型能够使用重构损失进行端到端训练。在本研究中,我们扩展了原始 DVP,使其能够处理场景中的多个物体。我们还利用其潜在空间的可解释性,通过解码器采样额外的训练示例并设计替代训练模式,这些模式不仅在图像空间,还在潜在空间中定义损失函数。这显著简化了训练过程,而通常由于图像空间重构损失中存在大量平坡区域而导致的训练困难。为评估这种方法的性能,我们提出了一个新的基准,包含多个二维物体,该基准涵盖了之前提出的 Multi-dSprites 数据集,同时更具可参数化特征。我们将在这些方式下扩展的 DVP 与两种基线方法 (MONet 和 LIVE) 进行比较,展示了其在重构质量和分解重叠物体方面的优势。我们还分析了所考虑损失函数引起的梯度,解释了它们如何影响训练效果,并讨论了可微分渲染在自编码器中的局限性以及可以采取的应对措施。

关键词

引用

@article{arxiv.2506.08191,
  title  = {Generative Learning of Differentiable Object Models for Compositional Interpretation of Complex Scenes},
  author = {Antoni Nowinowski and Krzysztof Krawiec},
  journal= {arXiv preprint arXiv:2506.08191},
  year   = {2025}
}