中文

使用多模态大型语言模型预测自然电影的脑反应

计算机视觉与模式识别 2025-07-29 v1 人工智能 神经元与认知

摘要

我们 presenting MedARC 团队的 Algonauts 2025 挑战解决方案。我们的管道利用来自各种最先进预训练模型的丰富多模态表示,涵盖视频(V-JEPA2)、语音(Whisper)、文本(Llama 3.2)、视觉文本(InternVL3)和视觉文本音频(Qwen2.5-Omni)。这些从模型中提取的特征被线性投影到潜在空间,时序对齐到 fMRI 时间序列,最终通过由共享组头加减主体特定残差头组成的轻量级编码器映射到皮层区块。我们在大量超参数设置下训练了数百种模型变体,在保留的电影上对其进行验证,并为每个主体的每个区块组装集成模型。我们的最终提交在测试集上实现了 0.2085 的平均 Pearson's 相关系数,将我们团队排在竞赛第四名。我们进一步讨论了一项临时优化,若实施可将我们提升至第二名。我们的结果表明,结合不同模态训练的模型特征、使用由共享-主体和单主体组件构成的简单架构、以及进行全面模型选择和集成,可提高对新电影刺激物的编码模型泛化能力。所有代码已在 GitHub 上公开。

关键词

引用

@article{arxiv.2507.19956,
  title  = {Predicting Brain Responses To Natural Movies With Multimodal LLMs},
  author = {Cesar Kadir Torrico Villanueva and Jiaxin Cindy Tu and Mihir Tripathy and Connor Lane and Rishab Iyer and Paul S. Scotti},
  journal= {arXiv preprint arXiv:2507.19956},
  year   = {2025}
}

备注

Code available at https://github.com/MedARC-AI/algonauts2025