中文

基于 Transformer 和 VAE 数据增强的 EEG 语音感知解码

音频与语音处理 2025-12-30 v2 计算与语言 人机交互 机器学习 声音

摘要

从非侵入性脑信号(如脑电图 EEG)解码语音,有望推动脑机接口 (BCI) 的发展,适用于无声通信和帮助语言障碍患者的辅助技术。然而,EEG 语音解码面临数据噪声、数据集有限以及在复杂任务(如语音感知)上性能较差等挑战。本研究通过采用变分自编码器 VAE 对 EEG 数据进行增强以提高数据质量,并应用在肌电图 EMG 任务中取得成功的前沿序列到序列深度学习架构用于 EEG 语音解码。此外,我们还针对词分类任务对该架构进行了适配。使用包含受试者听诂音语播报的语音数据的 Brennan 数据集,我们对数据进行预处理,并评估了用于 EEG 到单词/句子任务的分类模型和序列到序列模型。我们的实验表明,VAE 有望用于数据增强重构人造 EEG 数据。与我们的分类模型相比,序列到序列模型在生成句子方面取得了更具前景的性能,尽管两者都仍是具有挑战性的任务。这些发现为未来的 EEG 语音感知解码研究奠定了基础,可能的延伸包括语音产生任务,如无声或想象语音。

关键词

引用

@article{arxiv.2501.04359,
  title  = {Decoding EEG Speech Perception with Transformers and VAE-based Data Augmentation},
  author = {Terrance Yu-Hao Chen and Yulin Chen and Pontus Soederhaell and Sadrishya Agrawal and Kateryna Shapovalenko},
  journal= {arXiv preprint arXiv:2501.04359},
  year   = {2025}
}

备注

19 pages, 15 figures, 2 tables