中文

MindShot:基于 LLM 解码的多镜头 fMRI 视频重建

计算机视觉与模式识别 2025-08-05 v1

摘要

从 fMRI 中重建动态视频对于理解视觉认知并实现鲜活的脑机接口至关重要。然而,当前方法严重受限于单镜头剪辑,无法解决现实情景中多镜头的本质问题。多镜头重建面临根本性挑战:fMRI 信号在镜头之间混合、fMRI 与视频的时间分辨率不匹配掩盖了快速场景变化,以及缺乏专门的多镜头 fMRI-视频数据集。为克服这些限制,我们提出了一种新颖的划分-解码框架,用于多镜头 fMRI 视频重建。我们的核心创新点包括:(1)一个镜头边界预测模块,显式地将混合 fMRI 信号分解为镜头特定的片段。(2)使用 LLM 的生成式关键帧描述,解码来自每个片段的稳健文本描述,凭借高层次语义克服了时间模糊。(3)大规模数据合成(20k 样本),来自现有数据集。实验结果表明,我们的框架在多镜头重建保真度方面优于最先进的方法。消融研究确认 fMRI 分解和语义描述的关键作用,分解显著提高解码后的标题 CLIP 相似度提升了 71.8%。本工作为多镜头 fMRI 重建开辟了新范式,使通过显式分解和语义提示能够准确恢复复杂的视觉叙事。

关键词

引用

@article{arxiv.2508.02480,
  title  = {MindShot: Multi-Shot Video Reconstruction from fMRI with LLM Decoding},
  author = {Wenwen Zeng and Yonghuang Wu and Yifan Chen and Xuan Xie and Chengqian Zhao and Feiyu Yin and Guoqing Wu and Jinhua Yu},
  journal= {arXiv preprint arXiv:2508.02480},
  year   = {2025}
}