中文

SemVideo:通过层次语义指导从脑活动重建观看内容

计算机视觉与模式识别 2026-03-02 v2 人工智能

摘要

从脑活动重建动态视觉经验提供了探索人类视觉感知神经机制的有力途径。尽管近期在基于 fMRI 的图像重建方面取得了显著进展,但将此类成功扩展到视频重建仍是一个重大挑战。当前的 fMRI 到视频重建方法普遍存在两个主要局限:(i) 导致显著物体在不同帧中的视觉表征不一致,引发外观不匹配;(ii) 导致运动错位或突然的帧转换,表现为差异的时间一致性。为此,我们提出了 SemVideo,一个受层次语义信息指导的 fMRI 到视频重建框架。SemVideo 的核心是 SemMiner,一个层次指导模块,从原始视频刺激构建三个层次的语义线索:静态锚描述、运动导向叙述和整体概述。利用这一语义指导,SemVideo 包括三个关键组件:一个语义对齐解码器,用于将 fMRI 信号与来自 SemMiner 的 CLIP 风格嵌入对齐;一个运动适应解码器,用于基于新颖的三段式注意力融合架构重建动态运动模式;以及一个条件视频渲染器,利用层次语义指导进行视频重建。在 CC2017 和 HCP 数据集上的实验表明,SemVideo 在语义对齐和时间一致性方面均实现了优异性能,为 fMRI 到视频重建树立了新的国际前沿。

关键词

引用

@article{arxiv.2602.21819,
  title  = {SemVideo: Reconstructs What You Watch from Brain Activity via Hierarchical Semantic Guidance},
  author = {Minghan Yang and Lan Yang and Ke Li and Honggang Zhang and Kaiyue Pang and Yizhe Song},
  journal= {arXiv preprint arXiv:2602.21819},
  year   = {2026}
}