通过音频问答进行时序推理
计算与语言
2019-11-22 v1 机器学习
声音
音频与语音处理
摘要
多模态问答任务可用作研究能够感知并推理世界的系统的代理任务。回答关于不同输入模态类型的问题强调了推理的不同方面,如视觉推理、阅读理解、故事理解或导航。在本文中,我们利用音频问答(AQA)任务来研究机器学习模型的时序推理能力。为此,我们引入了诊断性音频问答(DAQA)数据集,其包含自然声音事件的音频序列以及程序化生成、探查时序推理各方面的问答对。我们将若干近期最先进的视觉问答方法适配到 AQA 任务,并用 DAQA 表明它们在需要深度时序推理的问题上表现不佳。最后,我们提出一个新模型——用于线性调制的多重辅助控制器(MALiMo),其扩展了近期的特征级线性调制(FiLM)模型并显著改进了其时序推理能力。我们期望 DAQA 能促进关于 AQA 与时序推理的研究,而 MALiMo 是迈向 AQA 模型的一步。
引用
@article{arxiv.1911.09655,
title = {Temporal Reasoning via Audio Question Answering},
author = {Haytham M. Fayek and Justin Johnson},
journal= {arXiv preprint arXiv:1911.09655},
year = {2019}
}