Clotho-AQA:一个众包音频问答数据集
声音
2022-06-20 v2 机器学习
音频与语音处理
摘要
音频问答(AQA)是一项多模态翻译任务,其中系统分析音频信号与自然语言问题,以生成所需的自然语言答案。本文中,我们介绍 Clotho-AQA,一个由 1991 个音频文件组成的音频问答数据集,每个文件时长 15 至 30 秒,选自 Clotho 数据集。对于每个音频文件,我们通过 Amazon Mechanical Turk 众包收集六个不同的问题及相应答案。问题与答案由不同标注者产出。每个音频的六个问题中,两类问题各两个分别设计为以“是”和“否”作答,其余两个问题具有其他单词作答。对于每个问题,我们从三位不同标注者收集答案。我们还给出两个基线实验以说明我们的数据集在 AQA 任务中的用法——一个基于 LSTM 的“是/否”型答案多模态二分类器,以及一个基于 LSTM 的 828 个单词答案多模态多分类器。二分类器达到 62.7% 准确率,多分类器达到 54.2% 的 top-1 准确率与 93.7% 的 top-5 准确率。Clotho-AQA 数据集可于 https://zenodo.org/record/6473207 免费在线获取。
引用
@article{arxiv.2204.09634,
title = {Clotho-AQA: A Crowdsourced Dataset for Audio Question Answering},
author = {Samuel Lipping and Parthasaarathy Sudarsanam and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2204.09634},
year = {2022}
}