中文

BrainMCLIP:基于CLIP多层特征融合的人脑图像解码

计算机视觉与模式识别 2025-10-23 v1

摘要

从fMRI解码图像通常涉及将脑活动映射到CLIP的最终语义层。为捕获更细致的视觉细节,许多方法会添加参数密集的VAE-based管道。然而,这些方法忽视了CLIP中间层中丰富的对象信息,也与大脑功能层次结构相矛盾。我们引入BrainMCLIP, pioneering一种参数高效的多层融合方法,由人类视觉系统的功能层次指导,无需单独的VAE路径。BrainMCLIP将来自功能不同视觉区(低/高层)的fMRI信号对齐到相应的中间和最终CLIP层,尊重功能层次。我们进一步引入交叉重构策略和新颖的多粒度损失。结果表明,BrainMCLIP在高度具竞争力的性能方面表现突出,尤其在高级语义指标方面,甚至在使用VAE管道的SOTA方法中达到或超越了最先进的水平。关键的是,它通过避免VAE路径,实现了比顶级基于VAE的SOTA方法减少71.7%的参数。通过利用中间CLIP特征,BrainMCLIP有效捕获了CLIP-only方法常忽视的视觉细节,在语义准确性与细节保真度之间取得了引人注目的平衡,而无需单独的VAE管道。

关键词

引用

@article{arxiv.2510.19332,
  title  = {BrainMCLIP: Brain Image Decoding with Multi-Layer feature Fusion of CLIP},
  author = {Tian Xia and Zihan Ma and Xinlong Wang and Qing Liu and Xiaowei He and Tianming Liu and Yudan Ren},
  journal= {arXiv preprint arXiv:2510.19332},
  year   = {2025}
}