填充词检测与分类:一个数据集与基准
计算与语言
2022-07-05 v2 声音
音频与语音处理
摘要
填充词如“uh”或“um”是人们用来示意正在停顿思考的声音或词。在媒体编辑中,从录音里发现并去除填充词是一项常见且繁琐的任务。自动检测并分类填充词可极大辅助该任务,但迄今为止关于此问题的研究很少发表。一个关键原因是缺乏带有标注填充词的数据集用于模型训练与评估。在本工作中,我们提出一个新的语音数据集 PodcastFillers,包含 35K 个标注的填充词以及 50K 个对播客中常见其他声音(如呼吸、笑声和词语重复)的标注。我们提出一种利用 VAD 与 ASR 检测填充词候选并用分类器区分填充词类型的流水线。我们在 PodcastFillers 上评估所提流水线,与若干基线比较,并给出详细的消融研究。特别地,我们评估了使用 ASR 的重要性及其与类似关键词 spotting 的无转写方法的对比。我们展示了我们的流水线取得了当前最优(SOTA)结果,且利用 ASR 明显优于关键词 spotting 方法。我们公开 PodcastFillers,希望我们的工作可作为未来研究的基准。
引用
@article{arxiv.2203.15135,
title = {Filler Word Detection and Classification: A Dataset and Benchmark},
author = {Ge Zhu and Juan-Pablo Caceres and Justin Salamon},
journal= {arXiv preprint arXiv:2203.15135},
year = {2022}
}
备注
To appear at Insterspeech 2022