TASED-Net:用于视频显著性检测的时序聚合空间编解码网络
计算机视觉与模式识别
2019-08-19 v1
摘要
TASED-Net是一种用于视频显著性检测的3D全卷积网络架构。它由两个构建模块组成:首先,编码器网络从若干连续帧组成的输入片段中提取低分辨率时空特征,随后预测网络在空间上解码所编码的特征,同时聚合所有时间信息。因此,从多帧输入片段产生单一的预测图。通过对视频以滑动窗口方式应用TASED-Net,可预测逐帧显著性图。所提方法假设任意帧的显著性图均可通过考虑有限数量的历史帧来预测。我们在视频显著性检测上的大量实验验证了该假设,并表明我们带有时间聚合方法的全卷积模型是有效的。TASED-Net在三个主要大规模视频显著性检测数据集DHF1K、Hollywood2和UCFSports上均显著优于以往的SOTA方法。在定性分析其结果后,我们观察到我们的模型尤其更善于关注显著的移动物体。
引用
@article{arxiv.1908.05786,
title = {TASED-Net: Temporally-Aggregating Spatial Encoder-Decoder Network for Video Saliency Detection},
author = {Kyle Min and Jason J. Corso},
journal= {arXiv preprint arXiv:1908.05786},
year = {2019}
}
备注
ICCV 2019 camera ready (Supplementary material: on CVF soon)