动作条件化下一帧图像预测中的实际问题
计算机视觉与模式识别
2018-02-09 v1
摘要
动作条件化图像预测问题是指:给定机器人当前观测的相机帧和机器人选定的动作,预测预期的下一帧。我们首次对两种近期流行模型进行比较,尤其针对车辆图像预测。主要发现是,动作平铺编码是导致CDNA模型卓越性能的最重要因素。我们借助动作平铺编码提出一个轻量模型,其具有与[action_video_prediction_honglak]相同的单解码器前馈架构。在真实驾驶数据集上,CDNA模型以约 {\bfseries million} 参数的网络规模取得了 的MSE和 的结构相似性(SSIM)。我们的新模型以少于 {\bfseries million} 参数的小网络,取得了与CDNA相当的 MSE和 SSIM。我们的模型所需内存更少、计算更高效,利于在自动驾驶车辆内部使用。
引用
@article{arxiv.1802.02975,
title = {Practical Issues of Action-conditioned Next Image Prediction},
author = {Donglai Zhu and Hao Chen and Hengshuai Yao and Masoud Nosrati and Peyman Yadmellat and Yunfei Zhang},
journal= {arXiv preprint arXiv:1802.02975},
year = {2018}
}
备注
12 pages; 7 figures