中文

从视觉问答到声学问答

机器学习 2019-03-01 v1 声音 音频与语音处理 机器学习

摘要

我们引入了声学问答(AQA)这一新任务,以推动声学推理方面的研究。AQA 任务包括分析由基本声音组合而成的声学场景,并回答与这些声音的位置和属性相关的问题。所问的这类关系型问题要求模型进行非平凡的推理才能正确回答。尽管类似问题在视觉推理领域已被广泛研究,我们尚未知晓有任何先前研究在声学领域解决该问题。我们提出了一种从基本声音生成声学场景的方法,以及使用模板为每个场景生成若干相关问题。我们还展示了用两种已在视觉推理中证明有效的模型(FiLM 和 MAC)获得的初步结果。

关键词

引用

@article{arxiv.1902.11280,
  title  = {From Visual to Acoustic Question Answering},
  author = {Jerome Abdelnour and Giampiero Salvi and Jean Rouat},
  journal= {arXiv preprint arXiv:1902.11280},
  year   = {2019}
}