中文

基于高效解码器与时空动作线索的极简视频显著性预测

计算机视觉与模式识别 2025-02-04 v1

摘要

本文提出 ViNet-S,一个基于 ViNet 架构与 U-Net 设计的 36MB 模型,其轻量级解码器在显著减小模型尺寸和参数量的同时不牺牲性能。此外,ViNet-A(148MB)融合了时空动作定位(STAL)特征,区别于使用动作分类主干的传统视频显著性模型。我们的研究表明,通过平均预测的显著性图,ViNet-S 和 ViNet-A 的集成在三个纯视觉和六个视听显著性数据集上达到了最先进的性能,在参数效率和实时性能方面均优于基于 Transformer 的模型,其中 ViNet-S 达到超过 1000fps 的速度。

关键词

引用

@article{arxiv.2502.00397,
  title  = {Minimalistic Video Saliency Prediction via Efficient Decoder & Spatio Temporal Action Cues},
  author = {Rohit Girmaji and Siddharth Jain and Bhav Beri and Sarthak Bansal and Vineet Gandhi},
  journal= {arXiv preprint arXiv:2502.00397},
  year   = {2025}
}

备注

Accepted at 2025 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2025)