面向视频预测结构化模型中可解释潜空间的探索
机器学习
2021-07-19 v1
摘要
我们关注由底层物理动力学支配的视频未来帧预测任务。我们研究所用的模型是以对象为中心的,即显式地处理对象表示,并在潜空间中传播损失。具体而言,我们的研究基于 Kipf 等人 \cite{kipf&al20} 近期的工作,其通过使用图神经网络在潜空间中对对象交互进行对比学习来预测下一状态。我们认为,以通用物理定律的形式向模型中注入显式归纳偏置,不仅有助于使模型更具可解释性,也能改善模型的整体预测。作为一个自然副产品,我们的模型可以学习到与图像中实际对象位置高度相似的特征图,而在训练时并未使用任何关于对象位置的显式监督。与假设以物理引擎形式完全掌握运动动力学知识的早期工作 \cite{jaques&al20} 相比,我们仅依赖通用物理定律的知识,例如世界由具有位置和速度的对象组成。我们提出了一种基于像素空间附加解码器损失,以课程式方式施加,以进一步精炼潜空间预测。在多种不同设定下的实验表明,尽管 Kipf 等人模型能有效捕捉对象交互,我们的模型在定位对象上可显著更有效,在我们实验的 4 个域中有 3 个取得了改进性能。此外,我们的模型能学习到高度可解释、近似实际对象位置的特征图。
引用
@article{arxiv.2107.07713,
title = {Towards an Interpretable Latent Space in Structured Models for Video Prediction},
author = {Rushil Gupta and Vishal Sharma and Yash Jain and Yitao Liang and Guy Van den Broeck and Parag Singla},
journal= {arXiv preprint arXiv:2107.07713},
year = {2021}
}
备注
Accepted at Weakly Supervised Representation Learning Workshop at IJCAI 2021