音频描述生成:听音而述
声音
2020-05-11 v4 计算与语言
音频与语音处理
摘要
越来越多的研究关注机器对音频事件的感知,其中大多涉及检测与分类任务。然而,类人的音频场景感知不仅包含检测与分类音频声音,还需概括不同音频事件之间的关系。图像描述等可比研究已开展,但音频领域仍相当空白。本文介绍了一个用于音频描述的人工标注数据集。其目的是自动生成描述音频场景的自然语句,并弥合机器对音频与图像感知之间的鸿沟。整个数据集以普通话标注,我们也包含了翻译的英文标注。我们为英文和普通话提供了一个基线编码器-解码器模型。两种语言得到了相近的 BLEU 分数:我们的模型可基于该数据集生成可理解且与数据相关的描述语句。
引用
@article{arxiv.1902.09254,
title = {Audio Caption: Listen and Tell},
author = {Mengyue Wu and Heinrich Dinkel and Kai Yu},
journal= {arXiv preprint arXiv:1902.09254},
year = {2020}
}
备注
accepted by ICASSP2019