中文

CineBrain:自然视听叙事处理过程中的大规模多模态脑数据集

计算机视觉与模式识别 2025-12-16 v2

摘要

大多数将脑信号解码为图像的研究(通常将其作为生成模型的先验)仅关注视觉内容。这忽略了大脑整合听觉和视觉信息的自然能力,例如,声音会强烈影响我们感知视觉场景的方式。为了研究这一点,我们提出了一项新任务:从视听刺激期间记录的多模态脑信号中重建连续视频刺激。为了实现这一点,我们引入了 CineBrain,这是第一个在视听观看期间同步 fMRI 和 EEG 的大规模数据集,包含六小时的《The Big Bang Theory》剧集用于跨模态对齐。我们还首次系统地探索了结合 fMRI 和 EEG 进行视频重建,并提出了 CineSync,一个使用多模态融合编码器和神经潜变量解码器重建动态视频的框架。CineSync 在动态重建中取得了 SOTA 性能,利用了 fMRI 和 EEG 的互补优势来提高视觉保真度。我们的分析表明,听觉皮层激活提高了解码精度,突显了听觉输入在视觉感知中的作用。项目页面:https://jianxgao.github.io/CineBrain。

关键词

引用

@article{arxiv.2503.06940,
  title  = {CineBrain: A Large-Scale Multi-Modal Brain Dataset During Naturalistic Audiovisual Narrative Processing},
  author = {Jianxiong Gao and Yichang Liu and Baofeng Yang and Jianfeng Feng and Yanwei Fu},
  journal= {arXiv preprint arXiv:2503.06940},
  year   = {2025}
}

备注

Project Page: https://jianxgao.github.io/CineBrain