中文

利用预训练AV-HuBERT挖掘视听特征进行多模态构音障碍语音重建

声音 2024-02-01 v1 音频与语音处理

摘要

构音障碍语音重建旨在通过提高清晰度和自然度,将构音障碍语音转换为正常语音。这是一项具有挑战性的任务,尤其对于重度构音障碍患者以及在复杂、嘈杂的声学环境中说话的情况。为应对这些挑战,我们提出了一种新颖的多模态框架,利用视觉信息(例如唇部运动)作为重建高度异常发音的额外线索。该多模态框架包括:(i)一个多模态编码器,用于从带有辅助视觉特征的构音障碍语音中提取鲁棒的音素嵌入;(ii)一个方差适配器,用于从提取的音素嵌入中推断正常的音素时长和音高轮廓;(iii)一个说话人编码器,用于编码说话人的声音特征;以及(iv)一个梅尔解码器,用于基于提取的音素嵌入、韵律特征和说话人嵌入生成重建的梅尔频谱图。在常用的UASpeech语料库上进行的客观和主观评估均表明,我们提出的方法在语音清晰度和自然度方面相较于基线系统取得了显著改进,尤其对于症状更严重的说话人。与原始构音障碍语音相比,重建语音为重度构音障碍患者实现了42.1%的绝对词错误率降低。

关键词

引用

@article{arxiv.2401.17796,
  title  = {Exploiting Audio-Visual Features with Pretrained AV-HuBERT for Multi-Modal Dysarthric Speech Reconstruction},
  author = {Xueyuan Chen and Yuejiao Wang and Xixin Wu and Disong Wang and Zhiyong Wu and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2401.17796},
  year   = {2024}
}

备注

Accepted by ICASSP 2024