文本到音频定位:建立字幕与声音事件之间的对应关系
声音
2021-02-24 v1 音频与语音处理
摘要
自动音频字幕生成是一项跨模态任务,通过生成自然语言描述来概括音频片段中的声音事件。然而,基于给定字幕对其对应音频中实际声音事件进行定位尚未被研究。本文贡献了一个AudioGrounding数据集,该数据集提供了Audiocaps中字幕与声音事件之间的对应关系,以及每个出现声音事件的位置(时间戳)。基于此,我们提出了文本到音频定位(TAG)任务,其交互式地考虑音频处理与语言理解之间的关系。我们给出了一种基线方法,取得了28.3%的事件F1分数和14.7%的复调声音检测分数(PSDS)。
引用
@article{arxiv.2102.11474,
title = {Text-to-Audio Grounding: Building Correspondence Between Captions and Sound Events},
author = {Xuenan Xu and Heinrich Dinkel and Mengyue Wu and Kai Yu},
journal= {arXiv preprint arXiv:2102.11474},
year = {2021}
}