中文

大时间位移延时视频的未来语义分割

计算机视觉与模式识别 2018-12-31 v1

摘要

视频理解的一个重要方面是预测其未来内容演变的能力。本文提出一种未来帧语义分割技术,用于预测延时视频中当前及未来帧的语义掩码。我们特别关注具有大时间位移的延时视频,以凸显模型捕捉时间上大幅度运动的能力。我们首先引入一个独特的语义分割预测数据集,包含超过 120,000 帧延时天空视频帧及相应的语义掩码,采集于北美地区跨度五年。该数据集对云量分析具有重大实用价值,其中云被视为感兴趣的非刚性物体。接下来,我们提出的循环网络架构脱离了使用时间卷积网络(TCN)(或前馈网络)的现有趋势,通过显式学习视频内容随时间演变的内部表示。实验评估显示,在提前 10 分钟(提前 60 分钟较 TCN 提升 21%)的预测中,分割任务的 mean IoU 较 TCN 提升 10.8%。此外,我们的模型同时从相同视频帧中测量当前与未来的太阳辐照度,两年内的归一化 MAE 为 10.5%。这些结果表明,具有注意力机制的循环记忆网络即使在不密集的时间采样下也能捕捉稠密流体的复杂平流与扩散流动特征,并且更适用于长时长视频的未来帧预测任务。

关键词

引用

@article{arxiv.1812.10786,
  title  = {Future semantic segmentation of time-lapsed videos with large temporal displacement},
  author = {Talha Siddiqui and Samarth Bharadwaj},
  journal= {arXiv preprint arXiv:1812.10786},
  year   = {2018}
}

备注

12 pages, 7 figures, https://bit.ly/2Bw7HGP