EEG2TEXT-CN:基于大语言模型与对比学习在ChineseEEG上的开放词表中文文本-EEG对齐探索性研究
计算与语言
2025-07-09 v3 人工智能
机器学习
多媒体
神经元与认知
摘要
我们提出EEG2TEXT-CN,据我们所知,这是最早针对中文量身定制的开放词表EEG到文本生成框架之一。我们的架构建立在具有生物学基础的EEG编码器(NICE-EEG)和紧凑的预训练语言模型(MiniLM)之上,通过掩码预训练和对比学习将多通道脑信号与自然语言表示进行对齐。使用ChineseEEG数据集的一个子集,其中每个句子包含大约十个中文字符,并与以256 Hz记录的128通道EEG对齐,我们将EEG分割为逐字符嵌入,并在零样本设置下预测完整句子。解码器采用teacher forcing和填充掩码进行训练,以适应变长序列。在超过1,500个训练-验证句子和300个留出测试样本上的评估显示出有前景的词汇对齐,最佳BLEU-1得分为6.38%。尽管句法流畅性仍然是一个挑战,但我们的发现证明了从EEG中进行非语音跨模态语言解码的可行性。这项工作在多语言脑到文本研究中开辟了新方向,并为未来中文认知-语言接口奠定了基础。
引用
@article{arxiv.2506.00854,
title = {EEG2TEXT-CN: An Exploratory Study of Open-Vocabulary Chinese Text-EEG Alignment via Large Language Model and Contrastive Learning on ChineseEEG},
author = {Jacky Tai-Yu Lu and Jung Chiang and Chi-Sheng Chen and Anna Nai-Yun Tung and Hsiang Wei Hu and Yuan Chiao Cheng},
journal= {arXiv preprint arXiv:2506.00854},
year = {2025}
}