中文

AVA-Speech:电影中语音活动的密集标注数据集

声音 2018-08-27 v2 音频与语音处理

摘要

语音活动检测(或端点检测)是语音识别、语言识别和说话人日志化等应用的重要处理步骤。在各种场景下,已采用基于音频和基于视觉的方法来完成该任务,通常针对最终应用进行定制。然而,许多先前工作是在合成环境、特定任务数据集或不可公开获取的数据集上报告结果。这使得比较不同方法并理解其优缺点变得困难。在本文中,我们描述了一个将公开发布的新数据集,其中包含 YouTube 视频中密集标注的语音活动,旨在为该任务创建一个共享的可用数据集。该数据集中的标注标明了三种不同的语音活动条件:干净语音、与音乐同时出现的语音,以及与噪声同时出现的语音,这些标注使得能够基于重叠噪声的存在来分析模型在更具挑战性条件下的性能。我们使用现成的、最先进的音频和视觉模型在 AVA-Speech 上报告了基准性能数据,作为促进未来研究的基线。

关键词

引用

@article{arxiv.1808.00606,
  title  = {AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies},
  author = {Sourish Chaudhuri and Joseph Roth and Daniel P. W. Ellis and Andrew Gallagher and Liat Kaver and Radhika Marvin and Caroline Pantofaru and Nathan Reale and Loretta Guarino Reid and Kevin Wilson and Zhonghua Xi},
  journal= {arXiv preprint arXiv:1808.00606},
  year   = {2018}
}

备注

Interspeech, 2018