中文

为大脑编码训练计算最优的视觉 Transformer

图像与视频处理 2024-10-29 v1 计算机视觉与模式识别 机器学习 神经元与认知

摘要

视觉 Transformer 为大脑编码的最优训练取决于三个因素:模型规模、数据规模和计算资源。本研究探讨了这三个支柱,关注数据扩展、模型扩展和高性能计算对大脑编码结果的影响。使用 VideoGPT 提取视频中有效的时空特征,并训练 Ridge 模型基于这些特征预测脑活动,我们进行了具有不同数据规模(10k、100k、1M、6M)和不同 GPT-2 模型配置(包括隐藏层维度、层数和注意力头数)的基准实验。我们还评估了以 32 位与 16 位浮点表示训练模型的效果。我们的结果表明,增加隐藏层维度显著改进了大脑编码性能,如所有受试者的更高 Pearson 相关系数所示。相比之下,注意力头的数量对编码结果没有显著影响。此外,增加层数在大脑编码相关性方面显示一些改进,但趋势不如隐藏层维度那样一致。数据扩展结果表明,更大的训练数据集导致更好的大脑编码性能,最大数据规模(6M)时观察到最高的 Pearson 相关系数。这些发现表明,数据扩展的影响在增强大脑编码性能方面大于模型扩展。此外,我们探索了浮点精度的影响,通过比较 32 位和 16 位表示。使用 16 位精度训练可获得与 32 位相同的大脑编码准确率,同时将训练时间缩短 1.17 倍,表明其在高性能计算任务中的效率。

关键词

引用

@article{arxiv.2410.19810,
  title  = {Training Compute-Optimal Vision Transformers for Brain Encoding},
  author = {Sana Ahmadi and Francois Paugam and Tristan Glatard and Pierre Lune Bellec},
  journal= {arXiv preprint arXiv:2410.19810},
  year   = {2024}
}