面向 MEG 基础模型的样本级分词策略的系统评估
机器学习
2026-02-19 v1 人工智能
神经元与认知
摘要
近年来,自然语言处理领域的成功激发了对大规模基础模型用于神经成像数据的兴趣。此类模型通常需要对连续神经时间序列数据进行离散化,称为“分词”。然而,不同分词策略对神经数据影响尚不清楚。本文对针对变压器基准的大规模神经成像模型 (LNM) 应用于磁性脑电图 (MEG) 数据的样本级分词策略进行系统评估。我们通过检查其信噪重建保真度以及对随后基础建模性能的影响(标记预测、生成数据的生物学合理性、主体特定信息的保留以及下游任务的性能)来比较可学习和非可学习的分词器。在可学习分词器方面,我们引入了一种基于自编码器的新方法。在三个公开可用的 MEG 数据集上进行实验,这些数据集涵盖不同的获取站点、扫描仪和实验范式。我们的结果表明,无论是可学习还是非可学习的离散化方案在重建准确度和大多数评估标准方面都实现了高水平的重建精度和相当可比的性能,表明简单固定的样本级分词策略可用于神经基础模型的开发。代码地址为 https://github.com/OHBA-analysis/Cho2026_Tokenizer。
引用
@article{arxiv.2602.16626,
title = {A Systematic Evaluation of Sample-Level Tokenization Strategies for MEG Foundation Models},
author = {SungJun Cho and Chetan Gohil and Rukuang Huang and Oiwi Parker Jones and Mark W. Woolrich},
journal= {arXiv preprint arXiv:2602.16626},
year = {2026}
}
备注
15 pages, 10 figures, 1 table