中文

基于自残差注意力引导异质转换器的标记MRI序列到音频合成

声音 2022-09-27 v3 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

理解标记MRI中所示的舌与口咽部肌肉形变与清晰语音之间的潜在关系,对推进语音运动控制理论与言语相关障碍的治疗具有重要作用。然而,由于二者表示异质,两种模态——即二维(中矢状切片)加时间的标记MRI序列与其对应的一维波形——之间的直接映射并不直观。为此,我们借助包含音高与共振的二维谱图作为中间表示,据此开发端到端深度学习框架,在有限数据集规模下从标记MRI序列翻译到其对应音频波形。我们的框架基于一种新颖的全卷积非对称转换器,并受自残差注意力策略引导,以专门利用言语过程中的运动肌肉结构。此外,我们利用具有相同话语的样本的成对相关性及潜空间表示解耦策略。进一步,我们引入生成对抗网络(GAN)的对抗训练方法,以提升生成谱图的真实感。我们使用共63个标记MRI序列及语音声学进行的实验结果表明,我们的框架能够从标记MRI序列生成清晰音频波形,超越竞争方法。因此,我们的框架为更好理解两模态间关系提供了巨大潜力。

关键词

引用

@article{arxiv.2206.02284,
  title  = {Tagged-MRI Sequence to Audio Synthesis via Self Residual Attention Guided Heterogeneous Translator},
  author = {Xiaofeng Liu and Fangxu Xing and Jerry L. Prince and Jiachen Zhuo and Maureen Stone and Georges El Fakhri and Jonghye Woo},
  journal= {arXiv preprint arXiv:2206.02284},
  year   = {2022}
}

备注

MICCAI 2022 (early accept, Oral Presentation ~3%)