中文

基于最优传输的构音障碍语音任务自适应方法

声音 2022-03-15 v3 计算与语言 音频与语音处理

摘要

在许多现实应用中,训练数据(源)与测试数据(目标)分布之间的不匹配会显著降低机器学习算法的性能。在语音数据中,此种不匹配的成因包括不同的声学环境或说话人特征。本文中,我们在构音障碍语音这一挑战性背景下,通过多源域/说话人自适应(MSDA/MSSA)来解决该问题。具体而言,我们提出一种基于最优传输的方法,称为基于加权联合最优传输的MSDA(MSDA-WDJOT)。我们直面构音障碍检测中的不匹配问题,所提方法优于基线与最先进的MSDA模型,较最佳竞争方法将检测准确率提升0.9%。随后我们将MSDA-WJDOT用于命令语音识别中的构音障碍说话人自适应。相较基线与最佳竞争模型,其分别提供16%与7%的命令错误率相对降低。有趣的是,MSDA-WJDOT给出源与目标之间、此情形下即说话人之间的相似度分数。我们利用该相似性度量定义目标说话人的构音障碍与健康分数,并以95%的准确率诊断构音障碍。

关键词

引用

@article{arxiv.2104.02535,
  title  = {Optimal Transport-based Adaptation in Dysarthric Speech Tasks},
  author = {Rosanna Turrisi and Leonardo Badino},
  journal= {arXiv preprint arXiv:2104.02535},
  year   = {2022}
}