中文

基于非侵入式EEG的语音与想象语音EEG到语音解码

信号处理 2025-12-30 v1 机器学习 声音

摘要

从神经信号恢复语音通信是脑机接口研究的核心目标,但EEG-based语音重建仍面临空间分辨率有限、易受噪声干扰以及缺乏想象语音中时间对齐声学目标等挑战。本研究提出一种EEG到语音范式,直接从非侵入式EEG信号重建语音,无需动态时间变形(DTW)或显式的时间对齐。该方法的管道使用面向受试者的生成器,以开环方式从EEG生成梅尔频谱图,再经预训练的合成器和自动语音识别(ASR)模块合成语音波形并解码文本。分别为语音语音和想象语音训练了独立的生成器,并通过预训练于语音语音后迁移到想象语音实现域适应。可选地采用基于最小语言模型的纠错模块,以纠正有限的ASR错误,同时保持语义结构。该框架在2秒和4秒语音条件下进行评估,使用声学层面指标(PCC、RMSE、MCD)和语言层面指标(CER、WER)进行评估。在语音语音和想象语音方面,声学相似性稳定,语言准确性相当。尽管较长语音的声学相似性下降,但文本层面的解码性能基本保持,单词位置分析显示解码错误在句子后部略有增加。基于最小语言模型的纠错始终能降低CER和WER,同时不引入语义失真。这些结果表明,无需显式时间对齐,即可实现语音语音和想象语音的直接、开环EEG到语音重建。

关键词

引用

@article{arxiv.2512.22146,
  title  = {EEG-to-Voice Decoding of Spoken and Imagined speech Using Non-Invasive EEG},
  author = {Hanbeot Park and Yunjeong Cho and Hunhee Kim},
  journal= {arXiv preprint arXiv:2512.22146},
  year   = {2025}
}

备注

20 pages, 7 figures, 4 tables