中文

ChineseEEG-2:用于阅读和聆听期间语义对齐与神经解码的 EEG 数据集

信号处理 2025-08-07 v1

摘要

EEG 基于神经解码需要大规模基准数据集。跨说、听、读三种模态的脑-语言配对数据对于将神经活动与大型语言模型 (LLM) 的语义表示对齐至关重要。然而,此类数据集较为罕见,尤其是针对非英语语言。本文提出 ChineseEEG-2,一个面向神经解码模型构建基准的高密度 EEG 数据集,旨在真实语言任务中实现语义对齐。我们基于之前的 ChineseEEG 数据集构建,后者聚焦于静默阅读。ChineseEEG-2 增加了两个主动模态:大声阅读 (RA) 和被动聆听 (PL),使用相同的中文语料库。在约 10.7 小时的大声阅读期间,同时记录了 EEG 和音频信号。随后将这些录音播放给另外八名受试者,收集约 21.6 小时的聆听 EEG。此设置可实现 RA 和 PL 模态之间的语音时序和语义对齐。ChineseEEG-2 包括 EEG 信号、精确的音频、来自预训练语言模型的对齐语义嵌入以及任务标签。与 ChineseEEG 联合使用,该数据集支持跨说、听、读的语义对齐学习,为神经解码算法提供基准测试,推动脑-LLM 在多模态语言任务中的对齐,尤其是在中文语境下。ChineseEEG-2 为下一代神经语义解码提供了基准数据集。

关键词

引用

@article{arxiv.2508.04240,
  title  = {ChineseEEG-2: An EEG Dataset for Multimodal Semantic Alignment and Neural Decoding during Reading and Listening},
  author = {Sitong Chen and Beiqianyi Li and Cuilin He and Dongyang Li and Mingyang Wu and Xinke Shen and Song Wang and Xuetao Wei and Xindi Wang and Haiyan Wu and Quanying Liu},
  journal= {arXiv preprint arXiv:2508.04240},
  year   = {2025}
}