中文

用于视频显著性预测的相关性引导视听融合

计算机视觉与模式识别 2024-11-19 v1

摘要

通常与视频帧同步的音频数据在引导观众视觉注意力方面起着至关重要的作用。将音频信息纳入视频显著性预测任务可以增强对人类视觉行为的预测。然而,现有的视听显著性预测方法通常直接融合音频和视觉特征,忽略了两种模态之间可能存在的不一致性,例如当音频作为背景音乐时。为了解决这个问题,我们提出了一种新颖的相关性引导视听显著性预测网络,称为 AVRSP。具体而言,相关性引导视听特征融合模块(RAVF)根据音频和视觉元素之间的语义相关性动态调整音频特征的保留程度,从而优化与视觉特征的整合过程。此外,多尺度特征协同(MS)模块整合了来自不同编码阶段的视觉特征,增强了网络表示不同尺度物体的能力。多尺度调节门(MRG)可以将关键的融合信息传递给视觉特征,从而优化多尺度视觉特征的利用。在六个视听眼动数据集上的大量实验表明,我们的 AVRSP 网络在视听显著性预测方面取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2411.11454,
  title  = {Relevance-guided Audio Visual Fusion for Video Saliency Prediction},
  author = {Li Yu and Xuanzhe Sun and Pan Gao and Moncef Gabbouj},
  journal= {arXiv preprint arXiv:2411.11454},
  year   = {2024}
}