中文

基于深度隐粒子无监督图像表示学习

计算机视觉与模式识别 2022-07-27 v2 人工智能 机器学习

摘要

我们提出了一种将物体位置与外观解耦的视觉数据新表示。我们的方法称为深度隐粒子(DLP),将视觉输入分解为低维隐“粒子”,其中每个粒子由其空间位置和其周围区域的特征描述。为驱动此类表示的学习,我们遵循基于VAE的方法,并引入基于空间softmax架构的粒子位置先验,以及对受粒子间Chamfer距离启发的证据下界损失的修改。我们证明我们的DLP表示对无监督关键点(KP)检测、图像操控以及由多个动态物体组成场景的视频预测等下游任务有用。此外,我们展示了该问题的概率解释自然提供了粒子位置的不确定性估计,除其他任务外可用于模型选择。视频与代码见:https://taldatech.github.io/deep-latent-particles-web/

关键词

引用

@article{arxiv.2205.15821,
  title  = {Unsupervised Image Representation Learning with Deep Latent Particles},
  author = {Tal Daniel and Aviv Tamar},
  journal= {arXiv preprint arXiv:2205.15821},
  year   = {2022}
}

备注

ICML 2022. Project webpage and code: https://taldatech.github.io/deep-latent-particles-web/