中文

面向视频视野预测的音视频动态标记融合 (DTFSal)

计算机视觉与模式识别 2025-04-17 v2

摘要

音视频视野预测旨在通过整合视觉和听觉信息来识别视频中显著区域,从而模拟人类的视觉注意力。虽然视觉单模态方法已取得显著进展,但有效地将听觉线索纳入仍然具有挑战性 due to复杂的时空相互作用和高计算需求。为此,我们提出了动态标记融合视野预测 (DFTSal),这是一种旨在在准确性和计算效率之间取得平衡的新型音视频视野预测框架。我们的方案具备多尺度视觉编码器,包含两个新颖模块:可学习标记增强模块 (LTEB),用于自适应加权标记以强调关键视野线索;以及动态可学习标记融合模块 (DLTFB),采用位移操作对特征进行重新组织和合并,有效捕获远程依赖性和详细的空间信息。在此基础上,音频分支处理原始音频信号以提取有意义的听觉特征。视觉和音频特征通过自适应多模态融合模块 (AMFB) 进行整合,AMFB采用局部、全局和自适应融合流实现精确的跨模态融合。最终得到的融合特征被处理以产生准确的视野图。对六个音视频基准进行广泛评估表明,DTFSal在保持计算效率的同时实现了SOTA性能。

关键词

引用

@article{arxiv.2504.10070,
  title  = {DTFSal: Audio-Visual Dynamic Token Fusion for Video Saliency Prediction},
  author = {Kiana Hooshanfar and Alireza Hosseini and Ahmad Kalhor and Babak Nadjar Araabi},
  journal= {arXiv preprint arXiv:2504.10070},
  year   = {2025}
}