用于视频显著性预测的时空自注意力网络
计算机视觉与模式识别
2022-01-19 v2
摘要
3D 卷积神经网络在计算机视觉的视频任务中取得了可喜结果,本文所探究的视频显著性预测亦在其中。然而,3D 卷积仅依据其核大小在固定局部时空上编码视觉表征,而人类注意始终被不同时刻的关联视觉特征所吸引。为克服此局限,我们提出一种新颖的用于视频显著性预测的时空自注意力 3D 网络(STSANet),其中在 3D 卷积骨干的不同层级部署多个时空自注意力(STSA)模块,以直接捕捉不同时步时空特征间的长程关联。此外,我们提出一种注意力多尺度融合(AMSF)模块,在语义与时空子空间中以上下文感知整合多级特征。大量实验证明了我们方法关键组件的贡献,且在 DHF1K、Hollywood-2、UCF 与 DIEM 基准数据集上的结果清晰证明了所提模型相较所有 SOTA 模型的优越性。
引用
@article{arxiv.2108.10696,
title = {Spatio-Temporal Self-Attention Network for Video Saliency Prediction},
author = {Ziqiang Wang and Zhi Liu and Gongyang Li and Yang Wang and Tianhong Zhang and Lihua Xu and Jijun Wang},
journal= {arXiv preprint arXiv:2108.10696},
year = {2022}
}