EEG-DLite: 高效大规模EEG模型训练的数据蒸馏框架
机器学习
2026-01-27 v2
摘要
大规模EEG基础模型在多种下游任务上显示出强大的泛化能力,但由于EEG数据的体积和可变质量,其训练仍然资源密集。本文引入EEG-DLite,一个数据蒸馏框架,通过选择性移除噪声和冗余样本来实现更高效的预训练。EEG-DLite首先使用自监督自编码器将EEG片段编码为紧凑的潜在表示,从而实现高效的样本选择,并对噪声不敏感。基于这些表示,EEG-DLite过滤离群值并最小化冗余, resulting in 一个更小却信息丰富的子集,保留了有效基础模型训练所必需的多样性。通过广泛实验,我们展示,在仅使用5%的2,500小时数据集经EEG-DLite精选后,即可在多个下游任务上获得与完整数据集相当,甚至更好的性能。据我们了解,这是首个针对EEG基础模型背景下的预训练数据蒸馏系统性研究。EEG-DLite为更有效率的生理基础建模提供了可扩展且实用的路径。代码可在 https://github.com/t170815518/EEG-DLite 访问。
引用
@article{arxiv.2512.12210,
title = {EEG-DLite: Dataset Distillation for Efficient Large EEG Model Training},
author = {Yuting Tang and Weibang Jiang and Shanglin Li and Yong Li and Chenyu Liu and Xinliang Zhou and Yi Ding and Cuntai Guan},
journal= {arXiv preprint arXiv:2512.12210},
year = {2026}
}
备注
Accepted by AAAI-2026