利用标记 MRI 通过 transformer 从语音过程中的舌体运动合成音频
图像与视频处理
2023-02-15 v1 计算机视觉与模式识别
声音
音频与语音处理
信号处理
摘要
研究从标记 MRI 测量的舌内组织点运动与口咽肌形变同可懂语音之间的关系,有助于推进语音运动控制理论并开发语音相关障碍的新治疗方法。然而,阐明这两类信息间的关系具有挑战性,部分原因在于时空运动场(即 4D 运动场)与一维音频波形间的数据结构差异。本工作中,我们提出一种高效的编码器-解码器转换网络,通过作为音频数据替代的 2D 频谱图来探索 4D 运动场中固有的预测信息。具体而言,我们的编码器基于 3D 卷积空间建模与基于 transformer 的时间建模。提取的特征由非对称 2D 卷积解码器处理,以生成对应于 4D 运动场的频谱图。此外,我们将生成对抗训练方法纳入框架,以进一步提升生成频谱图的合成质量。我们在 63 组配对运动场序列与语音波形上实验,表明我们的框架能够从运动场序列生成清晰音频波形。因此,该框架有潜力增进我们对这两种模态间关系的理解,并为语音障碍治疗开发提供参考。
引用
@article{arxiv.2302.07203,
title = {Synthesizing audio from tongue motion during speech using tagged MRI via transformer},
author = {Xiaofeng Liu and Fangxu Xing and Jerry L. Prince and Maureen Stone and Georges El Fakhri and Jonghye Woo},
journal= {arXiv preprint arXiv:2302.07203},
year = {2023}
}
备注
SPIE Medical Imaging: Deep Dive Oral