使用非线性先验从视频中学习可解释表示
计算机视觉与模式识别
2024-10-25 v1 机器学习
摘要
学习视觉数据的可解释表示是一个重要挑战,以人类可理解的方式使机器的决策更具可解释性,并提高在训练分布之外的泛化能力。为此,我们提出了一个深度学习框架,允许为视频指定非线性先验(例如牛顿物理),从而让模型学习可解释的潜变量并用于生成训练时未观察到的情景视频。我们通过将变分自编码器(VAE)的先验从简单 isotropic Gaussian 扩展为任意非线性时序 Additive Noise Model(ANM),该模型可描述大量过程(例如牛顿物理)。我们提出了一种新颖的线性化方法,用于构建近似先验的高斯混合模型(GMM),并推导了后验与先验 GMM 之间 KL 发散的稳健蒙特卡罗估计。我们在不同真实世界物理视频上进行了验证,包括摆锤、弹簧上的质量、自由落体和脉冲星(旋转中子星)。我们为每个实验指定物理先验,表明正确的变量被学习。模型训练后,我们会对不同的物理变量(如振荡幅度或添加空气阻力)进行干预,以生成以前未观察到的物理正确视频情景。
引用
@article{arxiv.2410.18539,
title = {Interpretable Representation Learning from Videos using Nonlinear Priors},
author = {Marian Longa and João F. Henriques},
journal= {arXiv preprint arXiv:2410.18539},
year = {2024}
}
备注
Accepted to BMVC 2024 (Oral)