中文

emg2speech:使用自监督语音模型合成语音

声音 2026-04-21 v2 计算与语言 音频与语音处理

摘要

我们提出了一个神经肌肉语音接口,将电位生理信号(EMG)从说话中或面部肌肉记录的电活动直接转换为语音。我们发现,自监督语音(S3)表示与肌肉活动电功率之间存在强烈的线性关系:一个简单的线性映射可实现从 S3 表示预测 EMG 功率,相关系数为 r = 0.85。此外,与不同语音操声相关联的 EMG 功率向量形成结构化、可分离的聚类。这些观察结果表明,S3 模型在 EMG 活动中所反映的,暗示其在隐式地编码语音操声机制。利用这种结构,我们将 EMG 信号映射到 S3 表示空间中,从而实现端到端的 EMG 到语音生成,无需显式的语音建模或声学模型训练。我们以一位来自肌萎缩性肌萎缩症(ALS)的受试者为例,将她在默默说话时记录的面部 EMG 记录转换为语音。

关键词

引用

@article{arxiv.2510.23969,
  title  = {emg2speech: Synthesizing speech from electromyography using self-supervised speech models},
  author = {Harshavardhana T. Gowda and Daniel C. Comstock and Lee M. Miller},
  journal= {arXiv preprint arXiv:2510.23969},
  year   = {2026}
}