SaSR-Net:源感知语义表示网络用于增强音视频问答
计算机视觉与模式识别
2024-11-12 v3
摘要
音视频问答(AVQA)是一项具有挑战性的任务,涉及基于视频中听觉和视觉信息回答问题。一个重大挑战是解释复杂的多模态场景,包括视觉对象和声源,并将它们与给定问题联系起来。在本文中,我们提出了源感知语义表示网络(SaSR-Net),一种用于AVQA的新型模型。SaSR-Net利用源感知可学习令牌来高效捕获和对齐音视频元素与相应问题。它通过空间和时间注意力机制简化了音视频信息的融合,以在多模态场景中识别答案。在Music-AVQA和AVQA-Yang数据集上的广泛实验表明,SaSR-Net优于最先进的AVQA方法。
引用
@article{arxiv.2411.04933,
title = {SaSR-Net: Source-Aware Semantic Representation Network for Enhancing Audio-Visual Question Answering},
author = {Tianyu Yang and Yiyang Nan and Lisen Dai and Zhenwen Liang and Yapeng Tian and Xiangliang Zhang},
journal= {arXiv preprint arXiv:2411.04933},
year = {2024}
}
备注
EMNLP 2024