NAAQA:一种用于声学问答的神经架构
计算与语言
2024-01-15 v3 机器学习
声音
音频与语音处理
摘要
声学问答(AQA)任务的目标是回答关于声学场景内容的自由形式文本问题。该任务受视觉问答(VQA)任务的启发。本文基于先前发布的CLEAR数据集,提出了一种新的AQA基准,即CLEAR2,其强调了声学输入特有的挑战。这些挑战包括处理可变时长的场景,以及由训练和测试集之间不同的基本声音构建的场景。我们还引入了NAAQA,一种利用声学输入特定属性的神经架构。在时间和频率上使用一维卷积处理声学内容的二维谱-时表示展现出有前景的结果,并能够降低模型复杂度。我们表明时间坐标图增强了时间定位能力,使网络性能提升约17个百分点。另一方面,频率坐标图对该任务影响甚微。NAAQA在AQA任务上达到了79.5%的准确率,参数数量比先前探索的VQA模型少约4倍。我们在由DAQA重建的独立数据集上评估了NAAQA的性能。我们还在CLEAR2和DAQA上测试了模型中加入MALiMo模块的效果。我们针对不同类型的问题提供了结果的详细分析。我们发布了生成CLEAR2以及NAAQA的代码,以促进这一新兴机器学习任务的研究。
引用
@article{arxiv.2106.06147,
title = {NAAQA: A Neural Architecture for Acoustic Question Answering},
author = {Jerome Abdelnour and Jean Rouat and Giampiero Salvi},
journal= {arXiv preprint arXiv:2106.06147},
year = {2024}
}
备注
Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI) in April 2021 (first revision February 2022)