基于互信息的无监督视频表示解耦方法
计算机视觉与模式识别
2020-11-18 v1 机器学习
摘要
视频预测是一项有趣且具有挑战性的任务,即从属于视频序列的给定上下文帧集合中预测未来帧。视频预测模型在机动规划、医疗健康、自主导航与仿真中具有潜在应用。未来帧生成的主要挑战之一源于视觉数据的高维特性。本工作中,我们提出互信息预测自编码器(MIPAE)框架,通过将视频表示分解为内容潜变量与易于预测的低维姿态潜变量,从而降低预测高维视频帧的任务难度。我们使用标准 LSTM 网络预测这些低维姿态表示。内容与预测的姿态表示被解码以生成未来帧。我们的方法利用视频潜生成因子的时间结构以及一种新颖的互信息损失来学习解耦的视频表示。我们还提出一种基于互信息间隙(MIG)的指标,以在 DSprites 与 MPI3D-real 数据集上定量评估解耦的有效性。MIG 分数与 MIPAE 预测帧的视觉优越性相一致。我们还在 LPIPS、SSIM 与 PSNR 评价指标上对我们的方法进行了定量比较。
引用
@article{arxiv.2011.08614,
title = {Mutual Information Based Method for Unsupervised Disentanglement of Video Representation},
author = {P Aditya Sreekar and Ujjwal Tiwari and Anoop Namboodiri},
journal= {arXiv preprint arXiv:2011.08614},
year = {2020}
}