中文

动作条件化下一帧图像预测中的实际问题

计算机视觉与模式识别 2018-02-09 v1

摘要

动作条件化图像预测问题是指:给定机器人当前观测的相机帧和机器人选定的动作,预测预期的下一帧。我们首次对两种近期流行模型进行比较,尤其针对车辆图像预测。主要发现是,动作平铺编码是导致CDNA模型卓越性能的最重要因素。我们借助动作平铺编码提出一个轻量模型,其具有与[action_video_prediction_honglak]相同的单解码器前馈架构。在真实驾驶数据集上,CDNA模型以约 {\bfseries 12.6{12.6} million} 参数的网络规模取得了 0.3986×103{0.3986} \times 10^{-3} 的MSE和 0.9846{0.9846} 的结构相似性(SSIM)。我们的新模型以少于 {\bfseries 1{1} million} 参数的小网络,取得了与CDNA相当的 0.3613×103{0.3613} \times 10^{-3} MSE和 0.9633{0.9633} SSIM。我们的模型所需内存更少、计算更高效,利于在自动驾驶车辆内部使用。

关键词

引用

@article{arxiv.1802.02975,
  title  = {Practical Issues of Action-conditioned Next Image Prediction},
  author = {Donglai Zhu and Hao Chen and Hengshuai Yao and Masoud Nosrati and Peyman Yadmellat and Yunfei Zhang},
  journal= {arXiv preprint arXiv:1802.02975},
  year   = {2018}
}

备注

12 pages; 7 figures