中文

基于置信度的EMG到语音自训练:利用合成EMG实现鲁棒建模

声音 2026-01-13 v2 音频与语音处理 信号处理

摘要

发声肌电图(EMG)到语音(V-ETS)模型从肌肉活动信号中重建语音,促进神经喉科诊断等应用。尽管具有潜力,但V-ETS的进展受到配对EMG-语音数据稀缺的阻碍。为解决这一问题,本研究提出了一种新颖的基于置信度的多说话人自训练(CoM2S)方法,以及新整理的Libri-EMG数据集。该方法利用预训练模型生成的合成EMG数据,随后通过基于音素级置信度的过滤机制,通过提出的自训练技术增强ETS模型。实验证明本方法提高了音素准确率,减少了音素混淆,并降低了词错误率,确认了CoM2S方法对V-ETS的有效性。为支持未来研究,本研究将发布代码和提出的Libri-EMG数据集——一个开放获取、时间对齐、多说话人的发声EMG和语音录音数据集。

关键词

引用

@article{arxiv.2506.11862,
  title  = {Confidence-Based Self-Training for EMG-to-Speech: Leveraging Synthetic EMG for Robust Modeling},
  author = {Xiaodan Chen and Xiaoxue Gao and Mathias Quoy and Alexandre Pitti and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2506.11862},
  year   = {2026}
}

备注

Version 2: Updated with acceptance notice for the IEEE Automatic Speech Recognition and Understanding (ASRU) Workshop 2025. Minor revisions from the review process incorporated. This is the camera-ready manuscript version