语音产生过程中从表面肌电图预测发音特征
音频与语音处理
2025-05-30 v2 人工智能
声音
摘要
我们提出了一种从语音产生过程中的表面肌电图(EMG)信号预测发音特征的模型。所提出的模型集成了卷积层和一个 Transformer 块,后接分别预测发音特征的模块。我们的方法对大多数发音特征实现了约 0.9 的高预测相关性。此外,我们证明这些预测的发音特征可以解码为可理解的语音波形。据我们所知,这是第一种通过发音特征从表面肌电图解码语音波形的方法,为基于肌电图的语音合成提供了一种新方法。此外,我们分析了肌电图电极放置与发音特征可预测性之间的关系,为优化肌电图电极配置提供了知识驱动的见解。源代码和解码语音样本公开可用。
引用
@article{arxiv.2505.13814,
title = {Articulatory Feature Prediction from Surface EMG during Speech Production},
author = {Jihwan Lee and Kevin Huang and Kleanthis Avramidis and Simon Pistrosch and Monica Gonzalez-Machorro and Yoonjeong Lee and Björn Schuller and Louis Goldstein and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:2505.13814},
year = {2025}
}
备注
Accepted for Interspeech2025