中文

贪婪分层变分自编码器用于大规模视频预测

计算机视觉与模式识别 2021-06-22 v3 人工智能 机器学习 机器人学

摘要

一个能泛化到多样场景的视频预测模型将使机器人等智能体能够通过该模型进行规划来完成各种任务。然而,尽管现有的视频预测模型在小型数据集上产生了有前景的结果,但当在大型且多样的数据集上训练时,它们遭受严重的欠拟合。为解决这一欠拟合挑战,我们首先观察到训练更大视频预测模型的能力常受 GPU 或 TPU 的内存约束瓶颈限制。同时,深度分层潜变量模型可通过捕捉未来观测的多级随机性产生更高质量的预测,但此类模型的端到端优化显然困难。我们的关键见解是,分层自编码器的贪婪与模块化优化可同时解决大规模视频预测的存储约束与优化挑战。我们引入贪婪分层变分自编码器(GHVAE),一种通过贪婪训练分层自编码器的每一层来学习高保真视频预测的方法。与最先进模型相比,GHVAE 在四个视频数据集上提供 17–55% 的预测性能提升,在真实机器人任务上提供 35–40% 更高的成功率,并且可通过简单添加更多模块来单调提升性能。

关键词

引用

@article{arxiv.2103.04174,
  title  = {Greedy Hierarchical Variational Autoencoders for Large-Scale Video Prediction},
  author = {Bohan Wu and Suraj Nair and Roberto Martin-Martin and Li Fei-Fei and Chelsea Finn},
  journal= {arXiv preprint arXiv:2103.04174},
  year   = {2021}
}

备注

Equal advising and contribution for last two authors