中文

基于 Transformer 的视频显著性预测与高时间维度解码

计算机视觉与模式识别 2024-01-17 v1 多媒体

摘要

近年来,寻找一种有效且高效的策略来利用空间和时间信息一直是视频显著性预测(VSP)中的热门研究课题。随着时空 Transformer 的出现,先前策略(如 3D 卷积网络和基于 LSTM 的网络)在捕捉长程依赖方面的弱点得到了有效弥补。虽然 VSP 已从时空 Transformer 中受益,但寻找聚合时间特征的最有效方法仍然具有挑战性。为解决这一问题,我们提出了一种带有高时间维度解码网络的基于 Transformer 的视频显著性预测方法(THTD-Net)。该策略解决了基于 Transformer 的时空编码器所提取特征之间缺乏复杂层次化交互的问题:具体而言,它不需要多个解码器,旨在解码器中逐步降低时间特征的维度。这种基于解码器的架构在 DHF1K、UCF-sports 和 Hollywood-2 等常用基准测试上,取得了与多分支及过度复杂模型相当的性能。

关键词

引用

@article{arxiv.2401.07942,
  title  = {Transformer-based Video Saliency Prediction with High Temporal Dimension Decoding},
  author = {Morteza Moradi and Simone Palazzo and Concetto Spampinato},
  journal= {arXiv preprint arXiv:2401.07942},
  year   = {2024}
}

备注

8 pages, 2 figures, 3 tables