中文

基于序列到序列网络从时间对齐音素合成实时MRI视频

音频与语音处理 2022-11-01 v1 声音

摘要

口部正中矢状面的实时磁共振成像(rtMRI)对语音产生研究具有重要意义。本文关注从所发音素序列估计语句级rtMRI视频。我们通过强制对齐获得时间对齐音素,从而得到与rtMRI帧对齐的帧级音素序列。我们提出一种带有transformer音素编码器和卷积帧解码器的序列到序列学习模型。随后,我们利用从预训练的条件变分自编码器(CVAE)采样得到的中间特征来改进学习。我们以特定受试者方式在8名受试者上训练,并通过主观测试展示性能。我们还使用气组织边界(ATB)分割的辅助任务来获取所提出模型的目标分数。我们表明,所提方法能够为未见语句生成逼真的rtMRI视频,且添加CVAE有助于在映射难以学习的受试者上学习序列到序列映射。

关键词

引用

@article{arxiv.2210.16881,
  title  = {Real-Time MRI Video synthesis from time aligned phonemes with sequence-to-sequence networks},
  author = {Sathvik Udupa and Prasanta Kumar Ghosh},
  journal= {arXiv preprint arXiv:2210.16881},
  year   = {2022}
}

备注

submitted to ICASSP 2023