基于时空扩散的语音到视频合成方法用于声道磁共振成像
计算机视觉与模式识别
2025-03-18 v1
摘要
理解言语过程中声道运动与所产生的声信号之间的关系,对于辅助临床评估以及制定个性化治疗和康复策略至关重要。为实现这一目标,我们提出了一种音频到视频生成框架,用于从言语信号生成声道的实时/电影磁共振成像(RT-/cine-MRI)可视化。我们的框架首先对RT-/cine-MRI序列和语音样本进行预处理,以实现时间对齐,确保视觉数据与音频数据的同步。然后,我们采用一种改进的稳定扩散模型,集成结构块和时间块,以有效捕捉同步数据中的运动特征和时间动态。这一过程使得从新的语音输入生成MRI序列成为可能,改善了音频到视觉数据的转换。我们在健康对照组和舌癌患者上评估了我们的框架,通过分析和比较合成视频中的声道运动。我们的框架展现出对新语音输入的适应性和有效的泛化能力。此外,积极的人工评估确认了其有效性,具有真实且准确的可视化效果,表明其在门诊治疗和声道可视化个性化模拟方面的潜力。
引用
@article{arxiv.2503.12102,
title = {A Speech-to-Video Synthesis Approach Using Spatio-Temporal Diffusion for Vocal Tract MRI},
author = {Paula Andrea Pérez-Toro and Tomás Arias-Vergara and Fangxu Xing and Xiaofeng Liu and Maureen Stone and Jiachen Zhuo and Juan Rafael Orozco-Arroyave and Elmar Nöth and Jana Hutter and Jerry L. Prince and Andreas Maier and Jonghye Woo},
journal= {arXiv preprint arXiv:2503.12102},
year = {2025}
}