中文

面向自然数据中基于时间稀疏编码的非线性解耦

机器学习 2021-03-18 v2 计算机视觉与模式识别 机器学习

摘要

我们构建了一个无监督学习模型,该模型实现了自然视频中潜在变化因子的非线性解耦。先前的研究表明,若环境中除少数因子外其余因子在任何时刻都保持恒定,则表征可被解耦。因此,针对该问题提出的算法仅在具有此确切属性的精心构建的数据集上进行了测试,尚不清楚其是否能迁移到自然场景。本文中,我们提供的证据表明,分割自然电影中的物体所经历的转移通常幅度较小且偶发大幅跳跃,这是时间稀疏分布的特征。我们利用这一发现提出了 SlowVAE,一种用于无监督表征学习的模型,该模型在相邻时间观测上使用稀疏先验,无需对变化因子数量做任何假设即可解耦生成因子。我们提供了可辨识性的证明,并表明该模型在多个已确立的基准数据集上可靠地学习解耦表征,常超越当前最优水平。我们还展示了向具有自然动态的视频数据集 Natural Sprites 和 KITTI Masks 的迁移能力,我们将它们作为基准贡献出来以引导解耦研究走向更自然的数据领域。

关键词

引用

@article{arxiv.2007.10930,
  title  = {Towards Nonlinear Disentanglement in Natural Data with Temporal Sparse Coding},
  author = {David Klindt and Lukas Schott and Yash Sharma and Ivan Ustyuzhaninov and Wieland Brendel and Matthias Bethge and Dylan Paiton},
  journal= {arXiv preprint arXiv:2007.10930},
  year   = {2021}
}

备注

ICLR 2021. Code is available at https://github.com/bethgelab/slow_disentanglement. The first three authors, as well as the last two authors, contributed equally