数据数量与多样性:面向 EEG 病理检测的高级机器学习模型中的数据影响
信号处理
2024-11-28 v1 机器学习
摘要
本研究探讨了数据数量和多样性对检测一般性 EEG 病理情况的机器学习模型性能的影响。我们利用了来自 Temple University Hospital 的 2,993 项 EEG 记录数据集,以及来自 Elmiko Biosignals sp. z o.o. 的 55,787 项记录数据集。后者包含来自 39 家医院的数据,患者集合多样且病情各异。因此,我们引入了 Elmiko 数据集——目前最大的公开 EEG 语料库。我们的发现表明,小而一致的数据集使广泛的模型能够实现高准确率;然而,病理条件、记录协议和标注标准的差异会导致显著的性能下降。尽管如此,增加可用记录的数量会改善预测准确率,甚至可以弥补数据多样性的不足,特别是对于基于注意力机制或 transformer 架构的神经网络。一种将这些网络与基于人工特征的梯度提升方法相结合的元模型在各异数据集上表现出色。
引用
@article{arxiv.2411.17709,
title = {Quantity versus Diversity: Influence of Data on Detecting EEG Pathology with Advanced ML Models},
author = {Martyna Poziomska and Marian Dovgialo and Przemysław Olbratowski and Paweł Niedbalski and Paweł Ogniewski and Joanna Zych and Jacek Rogala and Jarosław Żygierewicz},
journal= {arXiv preprint arXiv:2411.17709},
year = {2024}
}
备注
20 pages, 17 figures