中文

AVASpeech-SMAD:带有标签共现的强标注语音与音乐活动检测数据集

音频与语音处理 2021-11-03 v1 声音

摘要

我们提出了一个名为 AVASpeech-SMAD 的数据集,以辅助语音与音乐活动检测研究。通过添加帧级音乐标签,所提出的数据集扩展了现有的 AVASpeech 数据集,该数据集原本包含 45 小时的音频及语音活动标签。据我们所知,所提出的 AVASpeech-SMAD 是首个提供音乐与语音两者强复音标签的开源数据集。该数据集经过人工标注,并通过迭代交叉核对过程进行验证。我们还实现了一个简单的自动检查以进一步提升标签质量。我们还提供了两个最先进的 SMAD 系统的评估结果,作为未来参考的基准。

关键词

引用

@article{arxiv.2111.01320,
  title  = {AVASpeech-SMAD: A Strongly Labelled Speech and Music Activity Detection Dataset with Label Co-Occurrence},
  author = {Yun-Ning Hung and Karn N. Watcharasupat and Chih-Wei Wu and Iroro Orife and Kelian Li and Pavan Seshadri and Junyoung Lee},
  journal= {arXiv preprint arXiv:2111.01320},
  year   = {2021}
}