MRI2Speech:基于实时 MRI 记录的咀嚼运动进行语音合成
声音
2025-01-20 v2 人工智能
音频与语音处理
摘要
先前的基于实时 MRI(rtMRI)的语音合成模型高度依赖噪声的真实语音。直接对真实语音的梯谱进行损失,会将语音内容与 MRI 噪声 entangled 在一起,导致语音可理解性差。我们引入了一种新方法,适配多模态自监督 AV-HuBERT 模型用于从 rtMRI 中进行文本预测,并引入一种新的流式持续时间预测器用于说话人特定对齐。预测的文本和持续时间随后用于语音解码器,以合成任何新声线中的对齐语音。我们在两个数据集上进行了彻底的实验,展示了该方法对未见说话人的泛化能力。我们通过遮蔽 rtMRI 视频的部分内容来评估不同咀嚼器官对文本预测的影响。我们的方法在 USC-TIMIT MRI 语料库上实现了 15.18% 的词错误率(WER),显著优于当前最先进的技术。语音样本可在 https://mri2speech.github.io/MRI2Speech/ 查看。
引用
@article{arxiv.2412.18836,
title = {MRI2Speech: Speech Synthesis from Articulatory Movements Recorded by Real-time MRI},
author = {Neil Shah and Ayan Kashyap and Shirish Karande and Vineet Gandhi},
journal= {arXiv preprint arXiv:2412.18836},
year = {2025}
}
备注
Accepted at IEEE ICASSP 2025