众包一个音频描述数据集
声音
2019-07-23 v1 音频与语音处理
摘要
音频描述(audio captioning)是一个新颖的多模态翻译领域,其任务是创建音频信号内容的文本描述(例如“人们在大房间里说话”)。为该任务创建数据集需要大量工作,使得众包极具吸引力。本文提出一个基于三步的音频描述数据集众包框架,其基于广泛用于图像描述与机器翻译数据集创建的概念与实践。第一步收集初始描述。第二步获得每条初始描述的语法修正和/或改写版本。最后,对初始与编辑后描述进行评分,保留排名靠前的用于所生成的数据集。我们客观评估了我们的框架在创建音频描述数据集过程中的影响,就所获描述中的多样性和排版错误量而言。所得结果显示,最终数据集比初始描述具有更少的排版错误,且所生成数据集中每个声音平均拥有 Jaccard 相似度为 0.24 的描述,约等于两条十词描述具有相同词根的四词重合,表明这些描述虽相异但仍包含部分相同信息。
引用
@article{arxiv.1907.09238,
title = {Crowdsourcing a Dataset of Audio Captions},
author = {Samuel Lipping and Konstantinos Drossos and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1907.09238},
year = {2019}
}