中文

用于发声障碍语音检测的鲁棒嗓音质量特征嵌入

声音 2023-01-27 v2 人工智能 机器学习 音频与语音处理

摘要

全球约1.2%的人口存在发声障碍。因此,自动发声障碍语音检测引起了学术界和临床界的广泛关注。然而,现有的自动嗓音评估方法往往无法在训练条件之外或其他相关应用中泛化。本文提出一种深度学习框架,用于生成对嗓音质量敏感且跨语料库鲁棒的声学特征嵌入。我们将对比损失与分类损失相结合以联合训练深度学习模型。对输入语音样本使用数据扭曲方法以提升方法的鲁棒性。实验结果表明,我们的方法不仅取得了较高的语料库内与跨语料库分类准确率,还生成了对嗓音质量敏感且跨不同语料库鲁棒的良好嵌入。我们还在干净及三种退化变体的语料库内与跨语料库数据集上,将结果与三种基线方法进行比较,表明所提模型始终优于基线方法。

关键词

引用

@article{arxiv.2211.09858,
  title  = {Robust Vocal Quality Feature Embeddings for Dysphonic Voice Detection},
  author = {Jianwei Zhang and Julie Liss and Suren Jayasuriya and Visar Berisha},
  journal= {arXiv preprint arXiv:2211.09858},
  year   = {2023}
}

备注

This manuscript is submitted on July 06, 2022 to IEEE/ACM Transactions on Audio, Speech, and Language Processing for peer-review