面向音频问答的多尺度注意力
声音
2023-05-30 v1 人工智能
多媒体
音频与语音处理
摘要
音频问答(AQA)作为探索场景理解的广泛使用的代理任务,已受到更多关注。AQA具有挑战性,因为它需要对音频场景中不同尺度的事件进行综合的时间推理。然而,现有方法大多以简单模式将视觉问答任务的结构扩展到音频任务,在感知细粒度音频场景时可能表现不佳。为此,我们提出一个多尺度窗口注意力融合模型(MWAFM),由异步混合注意力模块和多尺度窗口注意力模块组成。前者旨在聚合单模态与跨模态时间上下文,后者捕捉不同长度的声音事件及其时间依赖关系,以实现更全面的理解。我们进行了大量实验,证明所提出的MWAFM能有效探索时间信息,从而在细粒度场景中促进AQA。代码:https://github.com/GeWu-Lab/MWAFM
引用
@article{arxiv.2305.17993,
title = {Multi-Scale Attention for Audio Question Answering},
author = {Guangyao Li and Yixin Xu and Di Hu},
journal= {arXiv preprint arXiv:2305.17993},
year = {2023}
}
备注
Accepted by InterSpeech 2023