中文

CASP-Net:从音视觉一致性感知视角重新思考视频显著性预测

计算机视觉与模式识别 2023-03-14 v1

摘要

引入音频流使视频显著性预测(VSP)能够模仿人脑的选择性注意机制。通过关注视听联合信息的益处,多数VSP方法能够利用视觉与音频模态间的语义关联,却忽略了因音视觉内在时间不一致性带来的负面效应。受生物体内多感官信息不一致性校正启发,本研究提出一种一致性感知的音视觉显著性预测网络(CASP-Net),其综合考虑音视觉语义交互与一致性感知。除用于视频帧与对应声源间优雅关联的双流编码器外,还设计了一种新颖的一致性感知预测编码,以迭代提升音频与视觉表征内部的一致性。为进一步聚合多尺度音视觉信息,引入显著性解码器用于最终显著性图生成。大量实验表明,所提CASP-Net在六个具挑战性的音视觉眼动追踪数据集上优于其他最先进方法。系统演示请见我们的项目网页。

关键词

引用

@article{arxiv.2303.06357,
  title  = {CASP-Net: Rethinking Video Saliency Prediction from an Audio-VisualConsistency Perceptual Perspective},
  author = {Junwen Xiong and Ganglai Wang and Peng Zhang and Wei Huang and Yufei Zha and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2303.06357},
  year   = {2023}
}

备注

10 pages, 7 figures, CVPR2023 accepted