将 ECAPA-TDNN 与 Wav2Vec2.0 嵌入引入口吃检测
声音
2022-04-05 v1 机器学习
音频与语音处理
摘要
由于可用数据集规模有限,在口吃检测(SD)任务中采用先进的深度学习(DL)架构具有挑战性。为此,本工作引入了利用在大规模音频数据集上针对不同任务预训练的深度模型所提取的语音嵌入的应用。具体而言,我们探索使用强调通道注意力、传播与聚合——时延神经网络(ECAPA-TDNN)和在 VoxCeleb 与 LibriSpeech 数据集上分别训练的 Wav2Vec2.0 模型所获得的音频表示。提取嵌入后,我们使用若干传统分类器(如 k 近邻、高斯朴素贝叶斯和神经网络)对口吃检测任务进行基准测试。与仅在有限的 SEP-28k 数据集上训练的标准 SD 系统相比,我们在总体准确率上取得了相对基线 16.74% 的提升。最后,我们表明组合两种嵌入以及拼接 Wav2Vec2.0 的多个层可分别将 SD 性能进一步提升至多 1% 和 2.64%。
引用
@article{arxiv.2204.01564,
title = {Introducing ECAPA-TDNN and Wav2Vec2.0 Embeddings to Stuttering Detection},
author = {Shakeel Ahmad Sheikh and Md Sahidullah and Fabrice Hirsch and Slim Ouni},
journal= {arXiv preprint arXiv:2204.01564},
year = {2022}
}
备注
Submitted to Interspeech 2022