中文

UniST:面向视频显著性预测与检测的统一显著性 Transformer

计算机视觉与模式识别 2023-09-18 v1

摘要

视频显著性预测与检测是蓬勃发展的研究领域,使计算机能够模拟类似于人类感知动态场景方式的视觉注意分布。尽管许多方法为视频显著性预测或视频显著目标检测任务量身打造了特定任务的训练范式,但鲜有研究致力于设计一种无缝桥接这两个不同任务的通用显著性建模框架。在本研究中,我们引入了统一显著性 Transformer(UniST)框架,其充分利用了视频显著性预测与视频显著目标检测的本质属性。除了提取帧序列的表征外,还设计了一个显著性感知 Transformer,以逐步增高的分辨率学习时空表征,同时融入有效的跨尺度显著性信息以产生鲁棒表征。此外,提出了特定任务的解码器来为每个任务执行最终预测。据我们所知,这是首个探索为两种显著性建模任务设计 Transformer 结构的工作。令人信服的实验表明,所提出的 UniST 在两个任务的七个具挑战性基准上均取得了优越性能,并显著优于其他最先进方法。

关键词

引用

@article{arxiv.2309.08220,
  title  = {UniST: Towards Unifying Saliency Transformer for Video Saliency Prediction and Detection},
  author = {Junwen Xiong and Peng Zhang and Chuanyue Li and Wei Huang and Yufei Zha and Tao You},
  journal= {arXiv preprint arXiv:2309.08220},
  year   = {2023}
}

备注

11 pages, 7 figures