中文

Speech2rtMRI:基于语音引导的实时 MRI 视频扩散模型

图像与视频处理 2024-09-25 v1 计算机视觉与模式识别 声音 音频与语音处理

摘要

理解语音生产的视觉与动力学信息可为第二语言学习系统设计以及视频游戏和动画中的发音角色创建提供信息。本工作引入一种数据驱动的方法,基于任意音频或语音输入,以 Magnetic Resonance Imaging (MRI) 视频形式视觉地表示人类声门在语音期间的关节运动。我们利用大型预训练语音模型,这些模型嵌入了先验知识,以扩散模型的方式将语音领域的先验知识泛化到未见数据。我们的发现表明,视觉生成显著受益于预训练的语音表示。我们也观察到,对单个音素的评估具有挑战性,但在语音单词的语境中进行评估则更为直接。当前结果的局限性包括舌头运动不平滑以及当舌头接触颚腭时出现视频失真。

关键词

引用

@article{arxiv.2409.15525,
  title  = {Speech2rtMRI: Speech-Guided Diffusion Model for Real-time MRI Video of the Vocal Tract during Speech},
  author = {Hong Nguyen and Sean Foley and Kevin Huang and Xuan Shi and Tiantian Feng and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2409.15525},
  year   = {2024}
}

备注

4 pages