中文

CACE-Net:联合引导注意力与对比增强用于有效音视频事件定位

计算机视觉与模式识别 2024-08-06 v1

摘要

音视频事件定位任务需要从不受约束的视频中识别同时出现的视觉和听觉事件,定位它们并分类其类别。在该领域,高效提取和集成音频与视觉信息一直具有挑战性。本文引入了 CACE-Net,与大多数现有方法不同,后者仅使用音频信号引导视觉信息。我们提出了音视频联合引导注意力机制,允许音频和视觉信息之间进行自适应双向跨模态注意力引导,从而减少模态之间的不一致性。此外,我们注意到现有方法在区分相似背景和事件方面存在困难,缺乏对事件分类的细粒度特征。因此,我们采用背景-事件对比增强以增加融合特征的辨识度,并使用微调的预训练模型从复杂多模态输入中提取更精细且易于辨认的特征。具体而言,我们增强了模型区分事件与背景细微差异的能力,并提高了事件分类在我们模型中的准确率。在 AVE 数据集上的实验表明,CACE-Net 在音视频事件定位任务上设立了新的基准,证明了我们所提出方法在处理复杂多模态学习和不受约束视频中的事件定位方面的有效性。代码已公开于 https://github.com/Brain-Cog-Lab/CACE-Net。

关键词

引用

@article{arxiv.2408.01952,
  title  = {CACE-Net: Co-guidance Attention and Contrastive Enhancement for Effective Audio-Visual Event Localization},
  author = {Xiang He and Xiangxi Liu and Yang Li and Dongcheng Zhao and Guobin Shen and Qingqun Kong and Xin Yang and Yi Zeng},
  journal= {arXiv preprint arXiv:2408.01952},
  year   = {2024}
}

备注

Accepted by ACM MM 2024. Code is available at this https://github.com/Brain-Cog-Lab/CACE-Net