关键帧化未来:用于视觉预测与规划的关键帧发现
机器学习
2020-05-11 v2 计算机视觉与模式识别
机器学习
摘要
诸如视频等时间序列观测包含了关于底层场景动力学的基本信息,但它们通常夹杂着非本质的、可预测的细节。处理这一问题的一种方法是聚焦于序列中信息量最大的时刻。我们提出一个模型,学习发现这些重要事件及其发生的时间,并利用它们来表示完整序列。我们使用一个分层的 Keyframe-Inpainter (KeyIn) 模型来实现这一点,该模型首先生成视频的关键帧,然后通过生成中间时刻的帧来补全其余部分。我们提出了一种完全可微的公式来高效学习这一过程。我们表明,KeyIn 能够在具有不同动力学和视觉特性的多个数据集中发现信息量大的关键帧。在规划任务上,KeyIn 优于其他近期的分层预测模型。更多详情,请访问项目网站 \url{https://sites.google.com/view/keyin}。
引用
@article{arxiv.1904.05869,
title = {Keyframing the Future: Keyframe Discovery for Visual Prediction and Planning},
author = {Karl Pertsch and Oleh Rybkin and Jingyun Yang and Shenghao Zhou and Konstantinos G. Derpanis and Kostas Daniilidis and Joseph Lim and Andrew Jaegle},
journal= {arXiv preprint arXiv:1904.05869},
year = {2020}
}
备注
Conference on Learning for Dynamics and Control, 2020. Website: https://sites.google.com/view/keyin/home