从视觉问答到声学问答
机器学习
2019-03-01 v1 声音
音频与语音处理
机器学习
摘要
我们引入了声学问答(AQA)这一新任务,以推动声学推理方面的研究。AQA 任务包括分析由基本声音组合而成的声学场景,并回答与这些声音的位置和属性相关的问题。所问的这类关系型问题要求模型进行非平凡的推理才能正确回答。尽管类似问题在视觉推理领域已被广泛研究,我们尚未知晓有任何先前研究在声学领域解决该问题。我们提出了一种从基本声音生成声学场景的方法,以及使用模板为每个场景生成若干相关问题。我们还展示了用两种已在视觉推理中证明有效的模型(FiLM 和 MAC)获得的初步结果。
引用
@article{arxiv.1902.11280,
title = {From Visual to Acoustic Question Answering},
author = {Jerome Abdelnour and Giampiero Salvi and Jean Rouat},
journal= {arXiv preprint arXiv:1902.11280},
year = {2019}
}