Clotho:一个音频描述数据集
声音
2019-10-22 v1 计算与语言
机器学习
音频与语音处理
摘要
音频描述是利用自由文本对通用音频内容进行描述的新任务。它是一项跨模态翻译任务(而非语音转文本),系统接受音频信号作为输入,并输出该信号的文本描述(即描述文本)。本文提出 Clotho,一个用于音频描述的数据集,包含 4981 个时长 15 至 30 秒的音频样本和 24 905 条长度为 8 至 20 词的描述文本,并给出一种基线方法以提供初步结果。Clotho 的构建侧重于音频内容与描述文本的多样性,且数据划分不会妨碍方法的训练或评估。所有声音均来自 Freesound 平台,描述文本通过 Amazon Mechanical Turk 及来自英语国家的标注者以众包方式获得。经后处理去除了唯一词、命名实体与语音转写。Clotho 可在线免费获取(https://zenodo.org/record/3490684)。
引用
@article{arxiv.1910.09387,
title = {Clotho: An Audio Captioning Dataset},
author = {Konstantinos Drossos and Samuel Lipping and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1910.09387},
year = {2019}
}