LITcoder:面向构建与比较编码模型的通用库
摘要
我们介绍了 LITcoder,一款用于构建和基准测试神经编码模型的开源库。作为灵活的后端,LITcoder 提供标准化工具,用于将连续刺激(如文本和语音)与脑数据对齐, 将刺激转化为表征特征, 将这些特征映射到脑数据上,并评估模型在保留数据的预测性能。该库实现了覆盖广泛方法学选择的模块化管道,使研究人员无需重新构建核心基础设施即可轻松组合、比较和扩展编码模型。此类选择包括脑数据集、脑区、刺激特征(包括基于神经网络的特征以及控制特征,如词汇频率)、降采样方式等。此外,库还提供内置日志记录、绘图功能,并能无缝集成到 Weights & Biases(W&B)等实验跟踪平台。我们通过在三个故事听力数据集上拟合多种编码模型来展示框架的可扩展性和通用性:LeBel 等(2023)、Narratives 数据集以及 Little Prince 数据集。我们还探讨了构建连续型 fMRI 数据编码模型的关键方法选择,阐明了考虑单个 TR 扫描中所有 token 的重要性(而不仅仅是取最后一个,即便已加权),纳入血流滞后效应,使用最小信息泄漏的 train-test 分割,以及考虑头部运动对编码模型预测能力的影响。总体而言,LITcoder 降低了编码模型实现的技术门槛,促进了跨模型和数据集的系统比较,推动方法学严谨性,并加速了高质量高性能脑活动预测模型的开发。项目页面:https://litcoder-brain.github.io
引用
@article{arxiv.2509.09152,
title = {LITcoder: A General-Purpose Library for Building and Comparing Encoding Models},
author = {Taha Binhuraib and Ruimin Gao and Anna A. Ivanova},
journal= {arXiv preprint arXiv:2509.09152},
year = {2026}
}
备注
Accepted to the NeurIPS 2025 Workshop on Data on the Brain & Mind, Findings Track. OpenReview: https://openreview.net/forum?id=c9GUBrE5RV