中文

SaSR-Net:源感知语义表示网络用于增强音视频问答

计算机视觉与模式识别 2024-11-12 v3

摘要

音视频问答(AVQA)是一项具有挑战性的任务,涉及基于视频中听觉和视觉信息回答问题。一个重大挑战是解释复杂的多模态场景,包括视觉对象和声源,并将它们与给定问题联系起来。在本文中,我们提出了源感知语义表示网络(SaSR-Net),一种用于AVQA的新型模型。SaSR-Net利用源感知可学习令牌来高效捕获和对齐音视频元素与相应问题。它通过空间和时间注意力机制简化了音视频信息的融合,以在多模态场景中识别答案。在Music-AVQA和AVQA-Yang数据集上的广泛实验表明,SaSR-Net优于最先进的AVQA方法。

关键词

引用

@article{arxiv.2411.04933,
  title  = {SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering},
  author = {Tianyu Yang and Yiyang Nan and Lisen Dai and Zhenwen Liang and Yapeng Tian and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2411.04933},
  year   = {2024}
}

备注

EMNLP 2024