中文

基于知识增强条件变分自编码器从动态 MRI 生成语音音频

声音 2025-12-02 v2 计算机视觉与模式识别

摘要

声道动态磁共振成像已成为言语运动研究中日益采用的成像模态。除了图像信号外,由于 MRI 采集环境的不可预测性,还可能发生系统性数据丢失、噪声污染和音频文件损坏。在这种情况下,从图像生成音频对于临床和研究应用中的数据恢复至关重要。然而,由于硬件限制、声学干扰和数据损坏,这仍然具有挑战性。现有的解决方案(如去噪和多阶段合成方法)在音频保真度和泛化能力方面面临局限。为了应对这些挑战,我们提出了一种知识增强条件变分自编码器,这是一种用于从动态 MRI 序列生成语音音频信号的新型两步“知识增强 + 变分推断”框架。该方法引入了两项关键创新:(1)整合未标记 MRI 数据以进行知识增强,以及(2)采用变分推断架构以提升生成建模能力。据我们所知,这是直接从动态 MRI 视频序列合成语音音频的首次尝试之一。所提出的方法在语音录制期间采集的开源动态声道 MRI 数据集上进行了训练和评估。实验结果证明了其在生成自然语音波形方面的有效性,同时解决了 MRI 特有的声学挑战,优于传统的基于深度学习的合成方法。

关键词

引用

@article{arxiv.2503.06588,
  title  = {Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder},
  author = {Yaxuan Li and Han Jiang and Yifei Ma and Shihua Qin and Jonghye Woo and Fangxu Xing},
  journal= {arXiv preprint arXiv:2503.06588},
  year   = {2025}
}