重新思考脑到文本解码中的跨被试数据划分
计算与语言
2025-08-26 v4
摘要
近期的重大里程碑已成功跨被试从非侵入式脑信号(如功能磁共振成像(fMRI)和脑电图(EEG))中重建自然语言。然而,我们发现当前用于跨被试脑到文本解码的数据集划分策略是错误的。具体而言,我们首先证明所有当前的划分方法都存在数据泄露问题,即验证数据和测试数据泄露到训练集中,导致解码模型显著过拟合和性能高估。在本研究中,我们开发了一种无数据泄露的正确跨被试数据划分标准,用于将 fMRI 和 EEG 信号解码为文本。我们利用提出的标准对一些 SOTA 脑到文本解码模型进行了正确的重新评估,以供进一步研究。
引用
@article{arxiv.2312.10987,
title = {Rethinking Cross-Subject Data Splitting for Brain-to-Text Decoding},
author = {Congchi Yin and Qian Yu and Zhiwei Fang and Changping Peng and Piji Li},
journal= {arXiv preprint arXiv:2312.10987},
year = {2025}
}