数据分区在监督式跨主体分析中EEG基深度学习模型性能中的作用:一项初步研究
信号处理
2025-05-20 v1 机器学习
摘要
深度学习正在通过有效发现信号中高度非线性模式,显著推动电脑神经信号(EEG)数据的分析。数据分区和交叉验证对于评估模型性能和确保研究可比性至关重要,因为它们可能因特定信号属性(如生物特征)产生不同结果和数据泄漏。这种可变性导致不可比较的研究,以及日益夸大性能声称,这对该领域不利。尽管如此,本领域尚不存在针对数据分区和交叉验证的综合指南,也不存在其对模型准确性、可靠性和可泛化性影响的定量评估。为帮助研究人员识别最佳实验策略,本文彻底考察数据分区和交叉验证在评估EEG深度学习模型中的作用。比较了五种交叉验证设置,涵盖三项监督式跨主体分类任务(BCI、帕金森和阿尔茨海默病检测)和四种复杂度递增的已建立架构(ShallowConvNet、EEGNet、DeepConvNet和基于时间的ResNet)。对超过10万个训练模型的比较表明,首先,除在可接受的within-subject分析情形下(如BCI),否则必须使用基于主体的交叉验证策略来评估EEG深度学习模型。其次,嵌套方法(N-LNSO)的可靠性优于非嵌套方法,后者容易出现数据泄漏,并倾向于大型模型对验证数据过拟合。总之,本工作为EEG深度学习研究者提供了数据分区和交叉验证的分析,并提供了避免数据泄漏的指南,当前的数据泄漏正在损害该领域,可能导致性能被高估。
引用
@article{arxiv.2505.13021,
title = {The role of data partitioning on the performance of EEG-based deep learning models in supervised cross-subject analysis: a preliminary study},
author = {Federico Del Pup and Andrea Zanola and Louis Fabrice Tshimanga and Alessandra Bertoldo and Livio Finos and Manfredo Atzori},
journal= {arXiv preprint arXiv:2505.13021},
year = {2025}
}
备注
Submitted for possible publication. GitHub repository: see https://github.com/MedMaxLab/eegpartition