从 EEG 基础模型中提取层级知识与主导知识的 DLink distillation 方法
机器学习
2026-05-12 v2
摘要
EEG 基础模型 (EFMs) 通过大规模预训练和下游微调实现强大的跨主体和跨任务泛化。通过经验分析,我们观察到:(i)任务适应的 EFMs 提供强大的解码性能,但在保留为推理 backbone 时会产生显著的计算开销,使得知识蒸馏成为优化紧凑学生模型的自然路径;(ii)直接从固定教师表示进行蒸馏未能充分利用 EFM 知识,因为任务判别性信息分布在中间层而非集中在最终层。这些观察激发了我们提出 DLink(Distilling Layer-wise and Dominant Knowledge,层级知识与主导知识蒸馏),一个受谱线引导的蒸馏框架,采用输入条件化层路由用于将 EFM 知识传递给紧凑学生。DLink 使用轻量级路由器聚合每个输入的教师层,并对幅度和相位谱进行对齐,以减轻压缩导致的学习表示中的谱线失真。经路由获得的教师知识由 project-then-compress 学生内部化;仅在训练期间使用教师和路由器。在四个 EEG 基准测试上进行实验表明,DLink 改进了匹配的紧凑学生模型,并与轻量级基线保持竞争力,缩小了与微调 EFMs 的差距,同时显著降低了参数数量、FLOPs 和仅使用 CPU 时的推理延迟。
引用
@article{arxiv.2604.15016,
title = {DLink: Distilling Layer-wise and Dominant Knowledge from EEG Foundation Models},
author = {Jingyuan Wang and Zhihao Jia and Chenyu Liu and Xinliang Zhou and Haoran Luo and Ziyu Jia and Yong Li and Fang Li and Junfeng Yao and Yi Ding},
journal= {arXiv preprint arXiv:2604.15016},
year = {2026}
}