中文

在大规模个体 fMRI 数据集中扩展脑编码的岭回归方法

机器学习 2024-03-29 v1 人工智能 神经元与认知 定量方法

摘要

利用神经影像数据进行脑编码是一项成熟的分析方法,旨在直接从复杂刺激特征(如电影帧)预测人类大脑活动。通常,这些特征是来自人工神经网络的潜在空间表示,而刺激则是图像、音频或文本输入。由于其良好的样本外泛化性能,岭回归是脑编码的一种常用预测模型。然而,当处理包含大量脑活动时空样本的大规模深度功能磁共振成像(fMRI)数据集时,训练岭回归模型可能非常耗时。本文评估了不同的并行化技术,以在 CNeuroMod Friends 数据集(目前可用的最大深度 fMRI 资源之一)上减少岭回归脑编码的训练时间。在多线程方面,我们的结果表明,Intel Math Kernel Library (MKL) 显著优于 OpenBLAS 库,在单台机器上使用 32 个线程时速度快 1.9 倍。随后,我们评估了 scikit-learn (MultiOutput) 中现成的 Dask 多 CPU 岭回归实现,并基于时间复杂度分析,提出了一种新的 Dask 并行化“批处理”版本。与我们的理论分析一致,MultiOutput 并行化被证明是不切实际的,即比单台机器上的多线程更慢。相比之下,Batch-MultiOutput 回归在计算节点和线程间扩展良好,与单线程 scikit-learn 执行相比,在使用 8 个计算节点和 32 个线程时提供了高达 33 倍的加速。因此,使用 Dask 的批处理并行化成为一种可扩展的方法,可在使用 scikit-learn 和大型 fMRI 数据集的高性能计算系统上进行岭回归脑编码。

关键词

引用

@article{arxiv.2403.19421,
  title  = {Scaling up ridge regression for brain encoding in a massive individual fMRI dataset},
  author = {Sana Ahmadi and Pierre Bellec and Tristan Glatard},
  journal= {arXiv preprint arXiv:2403.19421},
  year   = {2024}
}