中文

面向音频问答的多尺度注意力

声音 2023-05-30 v1 人工智能 多媒体 音频与语音处理

摘要

音频问答(AQA)作为探索场景理解的广泛使用的代理任务,已受到更多关注。AQA具有挑战性,因为它需要对音频场景中不同尺度的事件进行综合的时间推理。然而,现有方法大多以简单模式将视觉问答任务的结构扩展到音频任务,在感知细粒度音频场景时可能表现不佳。为此,我们提出一个多尺度窗口注意力融合模型(MWAFM),由异步混合注意力模块和多尺度窗口注意力模块组成。前者旨在聚合单模态与跨模态时间上下文,后者捕捉不同长度的声音事件及其时间依赖关系,以实现更全面的理解。我们进行了大量实验,证明所提出的MWAFM能有效探索时间信息,从而在细粒度场景中促进AQA。代码:https://github.com/GeWu-Lab/MWAFM

关键词

引用

@article{arxiv.2305.17993,
  title  = {Multi-Scale Attention for Audio Question Answering},
  author = {Guangyao Li and Yixin Xu and Di Hu},
  journal= {arXiv preprint arXiv:2305.17993},
  year   = {2023}
}

备注

Accepted by InterSpeech 2023