SEP-28k:一个来自口吃者播客的口吃事件检测数据集
音频与语音处理
2021-02-25 v1 声音
摘要
自动检测语音中的口吃事件的能力,可帮助言语病理学家追踪个体的流畅度随时间的变化,或有助于改进面向非典型言语模式人群的语音识别系统。尽管该领域兴趣日增,现有公开数据集过小,不足以构建可泛化的不流畅检测系统且缺乏充分标注。本工作中,我们引入播客口吃事件(SEP-28k)数据集,其包含逾 28k 个片段,标注有五类事件:阻塞、延长、声音重复、词语重复与插入。音频来自公共播客,主要由口吃者采访其他口吃者构成。我们在 SEP-28k 与公共 FluencyBank 数据集上基准测试了一组声学模型,并强调仅增加训练数据量便使各自上的相对检测性能提升 28% 与 24% F1。跨两数据集逾 32k 片段的标注将被公开发布。
引用
@article{arxiv.2102.12394,
title = {SEP-28k: A Dataset for Stuttering Event Detection From Podcasts With People Who Stutter},
author = {Colin Lea and Vikramjit Mitra and Aparna Joshi and Sachin Kajarekar and Jeffrey P. Bigham},
journal= {arXiv preprint arXiv:2102.12394},
year = {2021}
}
备注
Accepted to ICASSP 2021