中文

NeuroSwift:面向复杂场景 fMRI 视觉重建的轻量级跨被试框架

计算机视觉与模式识别 2025-10-23 v2 人机交互

摘要

通过计算机视觉技术从大脑活动中重建视觉信息,为理解视觉神经机制提供了直观的途径。尽管在使用生成模型解码 fMRI 数据方面取得了进展,但实现视觉刺激的准确跨被试重建仍然具有挑战性且计算成本高昂。这种困难源于神经表征中的被试间变异性,以及大脑对复杂视觉输入中核心语义特征的抽象编码。为了应对这些挑战,我们提出了 NeuroSwift,它通过扩散模型集成了互补的适配器:用于低级特征的 AutoKL 和用于语义的 CLIP。NeuroSwift 的 CLIP 适配器在 Stable Diffusion 生成的图像与 COCO 标题配对上进行训练,以模拟高级视觉皮层编码。为了实现跨被试泛化,我们在一个被试上进行预训练,然后仅微调 17% 的参数(全连接层)用于新被试,同时冻结其他组件。这使得在轻量级 GPU(三张 RTX 4090)上仅需每个被试一小时的训练即可实现 SOTA 性能,并且优于现有方法。

关键词

引用

@article{arxiv.2510.02266,
  title  = {NeuroSwift: A Lightweight Cross-Subject Framework for fMRI Visual Reconstruction of Complex Scenes},
  author = {Shiyi Zhang and Dong Liang and Yihang Zhou},
  journal= {arXiv preprint arXiv:2510.02266},
  year   = {2025}
}