中文

使用增强时空对齐网络的视频显著性预测

计算机视觉与模式识别 2020-01-03 v1

摘要

由于不同帧之间存在多种运动,学习有效的时空表征以实现准确的视频显著性预测(VSP)极具挑战性。为解决该问题,我们设计了专为 VSP 定制的有效时空特征对齐网络,主要包括两个关键子网络:多尺度可变形卷积对齐网络(MDAN)与双向卷积长短期记忆(Bi-ConvLSTM)网络。MDAN 以由粗到精的方式将相邻帧的特征对齐到参考帧,能够很好地处理各种运动。具体而言,MDAN 拥有金字塔特征层次结构,首先利用可变形卷积(Dconv)对齐跨帧的低分辨率特征,然后聚合对齐后的特征以对齐更高分辨率的特征,自上而下逐步增强特征。MDAN 的输出随后送入 Bi-ConvLSTM 进行进一步增强,其沿前向与后向时间方向捕获有用的长时程时间信息,以在复杂场景变换下有效引导注意方向偏移预测。最后,增强后的特征被解码以生成预测的显著性图。所提模型以端到端方式训练,无需任何复杂后处理。在四个 VSP 基准数据集上的大量评估表明,所提方法相较最先进方法取得了优越性能。源代码与所有结果将公开发布。

关键词

引用

@article{arxiv.2001.00292,
  title  = {Video Saliency Prediction Using Enhanced Spatiotemporal Alignment Network},
  author = {Jin Chen and Huihui Song and Kaihua Zhang and Bo Liu and Qingshan Liu},
  journal= {arXiv preprint arXiv:2001.00292},
  year   = {2020}
}