中文

多模态条件下的随机网络运动预测

计算机视觉与模式识别 2017-05-08 v1

摘要

给定视觉历史,视频场景的多种未来结果具有同等概率,换言之,未来结果的分布具有多模态性。标准回归器或分类器 notoriously 难以处理多模态问题:前者回归至均值,后者则将连续高维输出空间离散化。在本文中,我们提出了通过随机性处理此类多模态性的随机神经网络架构:物体、身体关节或帧的未来轨迹被表示为随机变量(而非确定性变量)的深度非线性变换。这些随机变量采样自简单的高斯分布,其均值和方差由视觉历史的卷积编码器输出参数化。我们引入了新型卷积架构用于预测未来身体关节轨迹,其性能优于全连接替代方案 \cite{DBLP:journals/corr/WalkerDGH16}。我们引入了基于光流扭曲的随机空间变换器用于预测未来帧,其性能优于确定性等效方案 \cite{DBLP:journals/corr/PatrauceanHC15}。训练随机网络涉及对随机变量进行难以处理的边缘化。我们比较了多种处理此类边缘化的训练方案:a) 直接从先验分布采样,b) 条件变分自编码器 \cite{NIPS2015_5775,DBLP:journals/corr/WalkerDGH16},以及 c) 一种提出的 K-最佳样本损失,该损失在固定“预测预算”下惩罚最佳预测。我们在物体轨迹预测、人体关节轨迹预测以及不同未来不确定性下的视频预测上展示了实验结果,定量和定性地验证了我们的架构选择和训练方案。

关键词

引用

@article{arxiv.1705.02082,
  title  = {Motion Prediction Under Multimodality with Conditional Stochastic Networks},
  author = {Katerina Fragkiadaki and Jonathan Huang and Alex Alemi and Sudheendra Vijayanarasimhan and Susanna Ricco and Rahul Sukthankar},
  journal= {arXiv preprint arXiv:1705.02082},
  year   = {2017}
}