中文

基于多粒度感知的弱监督视听注视预测

计算机视觉与模式识别 2022-08-01 v4

摘要

得益于深度学习技术的快速发展和大规模训练集的广泛可用,视频显著性检测模型的性能一直在稳步且显著地提升。然而,基于深度学习的视觉-听觉注视预测仍处于起步阶段。目前仅提供了少量视觉-听觉序列,其真实注视是在真实视觉-听觉环境中记录的。因此,在相同视觉-听觉环境下重新收集真实注视既低效也无必要。为解决此问题,本文以弱监督方式提出了一种新方法,以缓解视觉-听觉模型训练对大规模训练集的需求。仅使用视频类别标签,我们提出了选择性类激活映射(SCAM)及其升级版(SCAM+)。在时空-听觉环境下,前者遵循由粗到细的策略选择最具判别性的区域,这些区域通常能与真实人眼注视表现出高度一致性。后者为SCAM配备了额外的多粒度感知机制,使整个过程与真实人眼视觉系统更为一致。此外,我们从这些区域中蒸馏知识以获得完整的新时空-听觉(STA)注视预测(FP)网络,从而在视频标签不可用的情形下实现广泛应用。在不借助任何真实人眼注视的情况下,这些STA FP网络的性能可与全监督网络相媲美。代码与结果公开于 https://github.com/guotaowang/STANet。

关键词

引用

@article{arxiv.2112.13697,
  title  = {Weakly Supervised Visual-Auditory Fixation Prediction with Multigranularity Perception},
  author = {Guotao Wang and Chenglizhao Chen and Deng-Ping Fan and Aimin Hao and Hong Qin},
  journal= {arXiv preprint arXiv:2112.13697},
  year   = {2022}
}