中文

重新审视弱监督音视频视频解析中的跨模态融合

计算机视觉与模式识别 2023-11-15 v1

摘要

现有弱监督音视频视频解析工作采用混合注意力网络(HAN)作为多模态嵌入以捕捉跨模态上下文。其以共享网络嵌入音频与视觉模态,并在输入处执行交叉注意力。然而,这种早期融合方法高度纠缠两个并非完全相关的模态,导致在检测单模态事件时性能次优。为解决该问题,我们提出信使引导的中期融合 Transformer,以减少融合中无关联的跨模态上下文。信使将完整跨模态上下文压缩为紧凑表示,仅保留有用的跨模态信息。此外,由于麦克风从各方向捕获音频事件,而相机仅记录受限视场内的视觉事件,用于视觉事件预测的来自音频的未对齐跨模态上下文更为频繁。因此我们提出跨音频预测一致性以抑制无关音频信息对视觉事件预测的影响。实验一致表明,相比现有最优方法,我们的框架具有更优性能。

关键词

引用

@article{arxiv.2311.08151,
  title  = {Rethink Cross-Modal Fusion in Weakly-Supervised Audio-Visual Video Parsing},
  author = {Yating Xu and Conghui Hu and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2311.08151},
  year   = {2023}
}

备注

WACV 2024