中文

CAD——用于动态音视频问答的上下文多模态对齐

计算机视觉与模式识别 2023-10-31 v2

摘要

在音视频问答(AVQA)任务中,音视频模态可在三个层面学习:1)空间,2)时间,以及 3)语义。现有 AVQA 方法存在两个主要缺陷:通过网络传递的音视频(AV)信息未在空间和时间层面对齐;且跨模态(音频与视觉)语义信息在上下文中常不平衡;这导致性能不佳。本文提出一种新颖的端到端上下文多模态对齐(CAD)网络,通过以下方式解决 AVQA 方法中的挑战:i)引入无参数随机上下文块,确保空间层面稳健的音频与视觉对齐;ii)提出一种在自监督设定下用于时间层面动态音频与视觉对齐的预训练技术;以及 iii)引入交叉注意力机制以在语义层面平衡音频与视觉信息。所提出的新颖 CAD 网络在 MUSIC-AVQA 数据集上比 SOTA 方法平均提升整体性能 9.4%。我们还证明,我们对 AVQA 的贡献可添加至现有方法以提升其性能,而无需额外的复杂度要求。

关键词

引用

@article{arxiv.2310.16754,
  title  = {CAD -- Contextual Multi-modal Alignment for Dynamic AVQA},
  author = {Asmar Nadeem and Adrian Hilton and Robert Dawes and Graham Thomas and Armin Mustafa},
  journal= {arXiv preprint arXiv:2310.16754},
  year   = {2023}
}

备注

Accepted to IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2024