中文

利用自动语音识别改进腭裂语音的过高鼻音估计

音频与语音处理 2022-08-11 v1

摘要

过高鼻音是人类言语产生中的异常共鸣,尤其见于腭裂等颅面异常患者。在临床应用中,过高鼻音估计对腭裂诊断至关重要,因为其结果决定了后续手术与附加言语治疗。因此,设计自动过高鼻音评估方法将有助于言语语言病理学家做出精确诊断。现有的过高鼻音估计方法仅基于低资源腭裂数据集,利用基于统计或神经网络的特征进行声学分析。本文提出一种利用自动语音识别模型改进过高鼻音估计的新方法。具体地,我们首先使用语音转文本数据集以自动语音识别(ASR)为目标预训练编码器-解码器框架,然后在腭裂数据集上微调 ASR 编码器用于过高鼻音估计。得益于该设计,我们的过高鼻音估计模型可享有 ASR 模型的优势:1)与低资源腭裂数据集相比,ASR 任务通常包含通用领域的大规模语音数据,从而实现更好的模型泛化;2)ASR 数据集中的文本标注引导模型提取更好的声学特征。在两个腭裂数据集上的实验结果表明,我们的方法相较以往方法取得了更优性能。

关键词

引用

@article{arxiv.2208.05122,
  title  = {Improving Hypernasality Estimation with Automatic Speech Recognition in Cleft Palate Speech},
  author = {Kaitao Song and Teng Wan and Bixia Wang and Huiqiang Jiang and Luna Qiu and Jiahang Xu and Liping Jiang and Qun Lou and Yuqing Yang and Dongsheng Li and Xudong Wang and Lili Qiu},
  journal= {arXiv preprint arXiv:2208.05122},
  year   = {2022}
}

备注

Accepted by InterSpeech 2022