FitVid:像素级视频预测中的过拟合
计算机视觉与模式识别
2021-06-25 v1 机器学习
摘要
能够预测接下来发生什么的智能体可通过规划执行多种任务而无需额外训练。此外,此类智能体可在内部表示真实世界的复杂动态,从而获取对多种视觉感知任务有用的表示。这使得以已观测过去及潜在未来动作为条件预测视频未来帧成为一项有趣的任务,尽管近期有许多进展,其仍极具挑战。现有视频预测模型在简单窄基准上展现出有前景的结果,但在具有更复杂动态或更广领域的真实生活数据集上生成低质量预测。越来越多的证据表明,对训练数据的欠拟合是低质量预测的主要原因之一。本文中,我们认为当前视频模型中参数的低效使用是欠拟合的主因。因此,我们引入名为FitVid的新架构,其能在常用基准上严重过拟合,同时参数量与当前最先进模型相近。我们分析过拟合的后果,阐明其如何产生如通过重复训练数据生成高质量输出等意外结果,以及如何利用现有图像增强技术缓解。结果表明,FitVid在四个不同视频预测基准、四个不同指标上均优于当前最先进模型。
引用
@article{arxiv.2106.13195,
title = {FitVid: Overfitting in Pixel-Level Video Prediction},
author = {Mohammad Babaeizadeh and Mohammad Taghi Saffar and Suraj Nair and Sergey Levine and Chelsea Finn and Dumitru Erhan},
journal= {arXiv preprint arXiv:2106.13195},
year = {2021}
}