用于主动 BCIs 的大脑语言模型预训练:静默语音
计算与语言
2025-05-06 v2 人工智能
音频与语音处理
摘要
本文探讨了主动脑机接口(BCI)系统中的静默语音解码,这种方法比传统 BCI 应用更自然、更灵活。我们收集了一个新的静默语音数据集,包含来自 12 名受试者的超过 120 小时的脑电图(EEG)记录,捕获 24 个常用英文单词,用于语言模型的预训练和解码。跟随最近在 EEG 分类性能中通过自监督范式进行大规模模型预训练取得的成功,我们提出了大脑语言模型(Large Brain Language Model, LBLM),用于主动 BCI 中的静默语音解码。为预训练 LBLM,我们提出了未来光谱-时序预测(Future Spectro-Temporal Prediction, FSTP)预训练范式,从无标签 EEG 数据中学习有效的表示。与现有 EEG 预训练方法主要遵循掩码-重建范式不同,我们提出的 FSTP 方法在时域和频域上采用自回归建模,以捕捉 EEG 信号的时序和频谱依赖性。预训练后,我们在下游任务上微调 LBLM,包括单词级和语义级分类。大量实验表明,LBLM 在完全监督和预训练基准模型方面显著提升了性能。例如,在困难的跨会话设置下,我们的模型在语义级分类上达到 47.0% 的准确率,在单词级分类上达到 39.6% 的准确率,分别超过基准方法 5.4% 和 7.3%。我们的研究推进了主动 BCI 系统中的静默语音解码,为 EEG 语言模型预训练提供了一个创新解决方案,并为基础研究提供了一个新数据集。
引用
@article{arxiv.2504.21214,
title = {Pretraining Large Brain Language Model for Active BCI: Silent Speech},
author = {Jinzhao Zhou and Zehong Cao and Yiqun Duan and Connor Barkley and Daniel Leong and Xiaowei Jiang and Quoc-Toan Nguyen and Ziyi Zhao and Thomas Do and Yu-Cheng Chang and Sheng-Fu Liang and Chin-teng Lin},
journal= {arXiv preprint arXiv:2504.21214},
year = {2025}
}