PRISM:探索 EEG 基础模型在临床差异诊断中的异构预训练迁移
机器学习
2026-03-04 v1 人工智能
摘要
EEG 基础模型通常在狭窄来源的临床档案中进行预训练,并在来自同一生态系统的基准测试上进行评估,这使不清楚表示是否编码了神经生理学还是录制分布制造的制造业缺陷。我们引入 PRISM(Population Representative Invariant Signal Model),一种沿两个轴进行 ablation 的掩码自编码器——预训练人口和下游适应——保持架构和预处理固定。我们将狭窄来源的欧/美语料库(TUH + PhysioNet)与一个增强了多中心南亚临床录制的数据池进行比较,后者涵盖多个 EEG 系统。三个发现依次出现。首先,狭窄来源预训练在分布匹配的基准测试上获得更强的线性探针,而多样化预训练在微调下更具可适应性——这种权衡在单一协议评估下不可见。在三个来源语料库上训练的 PRISM 在大多数任务上与 REVE(92 个数据集,60,000+ 小时)相匹配或优于,表明有针对性的多样性可以替代无差异规模,数据集计数是模型比较的混淆变量。其次,在一个临床上具有挑战性且尚未测试过的任务——通过间歇性 EEG 区分癫痫与诊断类错综综合征——多样化 checkpoint 相对于狭窄来源 checkpoint 获得了 +12.3pp 的平衡准确率,这是所有评估中最大的差距。第三,系统性地,EEG-Bench 与 EEG-FM-Bench 在相同数据集上的模型排名相差最高可达 24pp;我们识别出六个具体来源,包括分块构建、checkpoint 选择、段长度和归一化,表明这些因素会复合性地叠加。
引用
@article{arxiv.2603.02268,
title = {PRISM: Exploring Heterogeneous Pretrained EEG Foundation Model Transfer to Clinical Differential Diagnosis},
author = {Jeet Bandhu Lahiri and Parshva Runwal and Arvasu Kulkarni and Mahir Jain and Aditya Ray Mishra and Siddharth Panwar and Sandeep Singh},
journal= {arXiv preprint arXiv:2603.02268},
year = {2026}
}
备注
14 pages, 1 figure, 5 tables