MindCine: 基于大规模预训练模型的多模态脑电到视频重建
计算机视觉与模式识别
2026-01-28 v2 人机交互
多媒体
摘要
由于脑电图的无创性与高时间分辨率,从脑电信号重建人类动态视觉感知具有重要的研究意义。然而,脑电到视频的重建仍面临挑战:1) 单一模态:现有研究仅将脑电信号与文本模态对齐,忽略了其他模态,且容易陷入过拟合问题;2) 数据稀缺:现有方法在有限的脑电-视频数据下往往难以训练收敛。为解决上述问题,我们提出了一种新框架 MindCine,以在有限数据上实现高保真视频重建。我们在训练阶段采用多模态联合学习策略引入文本之外的模态,并利用预训练的大型脑电模型缓解语义信息解码中的数据稀缺问题,同时专门设计了带有因果注意力的 Seq2Seq 模型用于解码感知信息。大量实验表明,我们的模型在定性和定量上均优于 SOTA 方法。此外,结果突显了不同模态互补优势的有效性,并表明利用大规模脑电模型能够通过缓解有限数据带来的挑战,进一步提升重建性能。
引用
@article{arxiv.2601.18192,
title = {MindCine: Multimodal EEG-to-Video Reconstruction with Large-Scale Pretrained Models},
author = {Tian-Yi Zhou and Xuan-Hao Liu and Bao-Liang Lu and Wei-Long Zheng},
journal= {arXiv preprint arXiv:2601.18192},
year = {2026}
}