中文

基于最优传输的可解释构音障碍说话人自适应

计算与语言 2023-09-13 v1 声音 音频与语音处理

摘要

本工作针对构音障碍语音识别这一挑战性场景中的训练数据(源)与测试数据(目标)分布失配问题。我们关注指令语音识别中的说话人自适应(SA),其中可获得多个源(即多个说话人)的数据。具体而言,我们提出一种基于最优传输的无监督多源域自适应(MSDA)算法,称为基于加权联合最优传输的多源域自适应(MSDA-WJDOT)。相较于说话人无关模型与最佳竞争方法,我们分别实现了指令错误率相对降低 16% 与 7%。所提方法的优势在于,与现有任何其他 SA 方法不同,它提供了一个可解释模型,在此场景下亦可被用于无需任何专门训练的构音障碍诊断。事实上,它给出了目标说话人与源说话人之间的贴近度度量,反映了二者在语音特征上的相似性。基于目标说话人与健康/构音障碍源说话人的相似性,我们进而定义目标说话人的健康/构音障碍分数,并借此进行构音障碍检测。该方法无需额外训练,在构音障碍诊断中达到 95% 的准确率。

关键词

引用

@article{arxiv.2203.07143,
  title  = {Interpretable Dysarthric Speaker Adaptation based on Optimal-Transport},
  author = {Rosanna Turrisi and Leonardo Badino},
  journal= {arXiv preprint arXiv:2203.07143},
  year   = {2023}
}

备注

submitted to interspeech 2022