中文

利用说话人表征与自监督上下文嵌入的口吃检测

声音 2023-06-02 v1 机器学习 音频与语音处理

摘要

由于可用数据集规模有限,在口吃检测(SD)任务中采用先进的深度学习架构具有挑战性。为此,本工作引入了从在大型音频数据集上针对不同任务预训练的深度学习模型提取的语音嵌入的应用。具体而言,我们探索使用分别在 VoxCeleb 和 LibriSpeech 数据集上训练的 emphasized channel attention, propagation, and aggregation time delay neural network (ECAPA-TDNN) 和 Wav2Vec2.0 模型获得的音频表征。提取嵌入后,我们使用若干传统分类器(如 K 近邻(KNN)、高斯朴素贝叶斯和神经网络)对口吃检测任务进行基准测试。与仅在有限的 SEP-28k 数据集上训练的标准 SD 系统相比,我们在非加权平均召回率(UAR)方面分别获得相对于基线 12.08%、28.71%、37.9% 的相对提升。最后,我们已表明组合两种嵌入以及拼接 Wav2Vec2.0 的多个层可分别将 UAR 进一步改善至多 2.60% 和 6.32%。

关键词

引用

@article{arxiv.2306.00689,
  title  = {Stuttering Detection Using Speaker Representations and Self-supervised Contextual Embeddings},
  author = {Shakeel A. Sheikh and Md Sahidullah and Fabrice Hirsch and Slim Ouni},
  journal= {arXiv preprint arXiv:2306.00689},
  year   = {2023}
}

备注

Accepted in International Journal of Speech Technology, Springer 2023 substantial overlap with arXiv:2204.01564