基于 Transformer 和 VAE 数据增强的 EEG 语音感知解码
音频与语音处理
2025-12-30 v2 计算与语言
人机交互
机器学习
声音
摘要
从非侵入性脑信号(如脑电图 EEG)解码语音,有望推动脑机接口 (BCI) 的发展,适用于无声通信和帮助语言障碍患者的辅助技术。然而,EEG 语音解码面临数据噪声、数据集有限以及在复杂任务(如语音感知)上性能较差等挑战。本研究通过采用变分自编码器 VAE 对 EEG 数据进行增强以提高数据质量,并应用在肌电图 EMG 任务中取得成功的前沿序列到序列深度学习架构用于 EEG 语音解码。此外,我们还针对词分类任务对该架构进行了适配。使用包含受试者听诂音语播报的语音数据的 Brennan 数据集,我们对数据进行预处理,并评估了用于 EEG 到单词/句子任务的分类模型和序列到序列模型。我们的实验表明,VAE 有望用于数据增强重构人造 EEG 数据。与我们的分类模型相比,序列到序列模型在生成句子方面取得了更具前景的性能,尽管两者都仍是具有挑战性的任务。这些发现为未来的 EEG 语音感知解码研究奠定了基础,可能的延伸包括语音产生任务,如无声或想象语音。
引用
@article{arxiv.2501.04359,
title = {Decoding EEG Speech Perception with Transformers and VAE-based Data Augmentation},
author = {Terrance Yu-Hao Chen and Yulin Chen and Pontus Soederhaell and Sadrishya Agrawal and Kateryna Shapovalenko},
journal= {arXiv preprint arXiv:2501.04359},
year = {2025}
}
备注
19 pages, 15 figures, 2 tables