中文

通过数据增强、类平衡损失与多上下文深度学习推进口吃检测

声音 2023-02-23 v1 机器学习 音频与语音处理

摘要

口吃是一种神经发育性言语障碍,以不受控制的发声(插入音)和核心行为(阻塞、重复和延长)为特征,由言语感觉运动失败引起。由于其复杂性,口吃检测(SD)是一项困难任务。若在早期阶段检测到,可帮助言语治疗师观察和纠正口吃者(PWS)的言语模式。PWS的口吃语音通常数量有限且高度不平衡。为此,我们通过多分支(MB)方案并加权各类别在总体损失函数中的贡献来解决SD领域的类不平衡问题,从而在SEP-28k数据集上相比基线(StutterNet)在口吃类别上取得巨大改进。为应对数据稀缺,我们在多分支训练方案之上研究了数据增强的有效性。增强训练在宏F1分数(F1)上以4.18%的相对优势优于MB StutterNet(干净)。此外,我们提出了多上下文(MC)StutterNet,其利用口吃语音的不同上下文,相比基于单上下文的MB StutterNet在F1上总体提升4.48%。最后,我们展示了在跨语料库场景下应用数据增强,相比干净训练在F1上以13.23%的相对优势提升整体SD性能。

关键词

引用

@article{arxiv.2302.11343,
  title  = {Advancing Stuttering Detection via Data Augmentation, Class-Balanced Loss and Multi-Contextual Deep Learning},
  author = {Shakeel A. Sheikh and Md Sahidullah and Fabrice Hirsch and Slim Ouni},
  journal= {arXiv preprint arXiv:2302.11343},
  year   = {2023}
}

备注

Accepted in IEEE Journal of Biomedical Health Informatics 2023