连接大脑与语义:一种语义增强 fMRI 到视频重建的层次化框架
计算机视觉与模式识别
2026-05-15 v1
摘要
从功能磁共振成像(fMRI)中重建动态视觉体验为视频,对于推进对神经过程的理解至关重要。然而,当前的 fMRI 到视频重建方法受到嘈杂 fMRI 信号与视频丰富内容之间语义鸿沟的阻碍,这源于对不完整语义嵌入的依赖,这些嵌入既不能捕获视频特定线索(如动作),也不能整合先验知识。为此,我们从人脑的双通路处理机制中汲取灵感,引入 CineNeuron,一种用于从 fMRI 信号进行语义增强视频重建的新型层次化框架,包含两个协同阶段。首先,自下而上的语义丰富阶段将 fMRI 信号映射到一个丰富的嵌入空间,该空间全面捕获文本语义、图像内容、动作概念和物体类别。其次,自上而下的记忆整合阶段利用所提出的 Mixture-of-Memories 方法,从先前观察到的数据中动态选择相关的“记忆”,并将它们与 fMRI 嵌入融合以优化视频重建。在两个 fMRI 到视频基准上的广泛实验结果表明,CineNeuron 在各项指标上均超越了现有方法。
引用
@article{arxiv.2605.14569,
title = {Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction},
author = {Yujie Wei and Chenglong Ma and Jianxiong Gao and Chenhui Wang and Shiwei Zhang and Biao Gong and Shuai Tan and Hangjie Yuan and Hongming Shan},
journal= {arXiv preprint arXiv:2605.14569},
year = {2026}
}
备注
Accepted to CVPR 2026