中文

语音产生过程中从表面肌电图预测发音特征

音频与语音处理 2025-05-30 v2 人工智能 声音

摘要

我们提出了一种从语音产生过程中的表面肌电图(EMG)信号预测发音特征的模型。所提出的模型集成了卷积层和一个 Transformer 块,后接分别预测发音特征的模块。我们的方法对大多数发音特征实现了约 0.9 的高预测相关性。此外,我们证明这些预测的发音特征可以解码为可理解的语音波形。据我们所知,这是第一种通过发音特征从表面肌电图解码语音波形的方法,为基于肌电图的语音合成提供了一种新方法。此外,我们分析了肌电图电极放置与发音特征可预测性之间的关系,为优化肌电图电极配置提供了知识驱动的见解。源代码和解码语音样本公开可用。

关键词

引用

@article{arxiv.2505.13814,
  title  = {Articulatory Feature Prediction from Surface EMG during Speech Production},
  author = {Jihwan Lee and Kevin Huang and Kleanthis Avramidis and Simon Pistrosch and Monica Gonzalez-Machorro and Yoonjeong Lee and Björn Schuller and Louis Goldstein and Shrikanth Narayanan},
  journal= {arXiv preprint arXiv:2505.13814},
  year   = {2025}
}

备注

Accepted for Interspeech2025