中文

CoLM-DSR:利用神经编解码语言建模进行多模态构音障碍语音重建

声音 2024-06-25 v2 计算机视觉与模式识别 音频与语音处理

摘要

构音障碍语音重建(DSR)旨在将构音障碍语音转换为正常语音。它仍然存在说话人相似度低和韵律自然度差的问题。在本文中,我们提出了一种多模态DSR模型,通过利用神经编解码语言建模来改善重建结果,特别是在说话人相似度和韵律自然度方面。我们提出的模型包括:(i)一个多模态内容编码器,用于从构音障碍语音中提取鲁棒的音素嵌入,并辅以视觉输入;(ii)一个说话人编解码编码器,用于从构音障碍语音中提取并归一化说话人感知的编解码,以提供原始音色和正常韵律;(iii)一个基于编解码语言模型的语音解码器,用于根据提取的音素嵌入和归一化的编解码重建语音。在常用的UASpeech语料库上的评估表明,我们提出的模型在说话人相似度和韵律自然度方面可以实现显著改进。

关键词

引用

@article{arxiv.2406.08336,
  title  = {CoLM-DSR: Leveraging Neural Codec Language Modeling for Multi-Modal Dysarthric Speech Reconstruction},
  author = {Xueyuan Chen and Dongchao Yang and Dingdong Wang and Xixin Wu and Zhiyong Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2406.08336},
  year   = {2024}
}

备注

Accepted by Interspeech 2024