中文

基于塑性 Transformer 从标记 MRI 与非负矩阵分解合成语音音频

声音 2023-09-27 v1 人工智能 计算机视觉与模式识别 音频与语音处理 信号处理

摘要

舌头复杂的 3D 结构由局部功能单元组成,在语音产生中起着关键作用。当使用标记 MRI 测量时,这些功能单元表现出凝聚性位移及派生量,促进了复杂的语音产生过程。基于非负矩阵分解的方法已被证明可通过运动特征估计功能单元,得到一组基元块及相应的权重图。研究权重图与语音声学之间的联系,可为复杂的语音产生过程提供重要见解。为此,在本工作中,我们利用二维频谱图作为代理表示,并开发了一个端到端深度学习框架,用于将权重图转换为相应的音频波形。我们提出的塑性轻量 Transformer(PLT)框架基于方向积相对位置偏置和单级空间金字塔池化,从而能够灵活处理尺寸可变的权重图到固定尺寸频谱图的转换,且不丢失输入信息或扩展维度。此外,我们的 PLT 框架高效建模宽矩阵输入的全局相关性。为了在训练样本相对有限的情况下提升生成频谱图的真实感,我们应用了带最大均值差异约束的成对语句一致性与对抗训练。在 29 名受试者说两个语句的数据集上的实验结果表明,我们的框架能够从权重图合成语音音频波形,优于常规卷积和 Transformer 模型。

关键词

引用

@article{arxiv.2309.14586,
  title  = {Speech Audio Synthesis from Tagged MRI and Non-Negative Matrix Factorization via Plastic Transformer},
  author = {Xiaofeng Liu and Fangxu Xing and Maureen Stone and Jiachen Zhuo and Sidney Fels and Jerry L. Prince and Georges El Fakhri and Jonghye Woo},
  journal= {arXiv preprint arXiv:2309.14586},
  year   = {2023}
}

备注

MICCAI 2023 (Oral presentation)