中文

口吃现象鲜少单独出现——将其检测作为多标签问题

音频与语音处理 2022-10-31 v1 声音

摘要

需要特别适配的语音识别模型来处理口吃语音。为使这些模型能被针对性使用,必须可靠检测口吃语音。近期工作将口吃视为多类分类问题,或将每种口吃类型的检测视为孤立任务;这未能捕捉口吃的本质,即一种口吃现象鲜少单独出现,亦即与其他类型共存。本工作探索一种基于改进 wav2vec 2.0 系统的端到端口吃检测与分类方法,将其作为多标签问题。该方法在包含英语与德语口吃语音的三个数据集组合上评估,在 SEP-28k-Extended 数据集上取得了口吃检测的 state-of-the-art 结果。实验结果提供了特征可迁移性及该方法跨数据集与语言泛化能力的证据。

关键词

引用

@article{arxiv.2210.15982,
  title  = {Dysfluencies Seldom Come Alone -- Detection as a Multi-Label Problem},
  author = {Sebastian P. Bayerl and Dominik Wagner and Florian Hönig and Tobias Bocklet and Elmar Nöth and Korbinian Riedhammer},
  journal= {arXiv preprint arXiv:2210.15982},
  year   = {2022}
}

备注

Submitted to ICASSP 2023