中文

DynaMind:通过对齐时间动态与多模态语义至引导扩散模型,从脑电图重建动态视觉场景

计算机视觉与模式识别 2025-09-03 v1 人工智能 人机交互 信号处理

摘要

从脑电图(EEG)信号重建动态视觉场景仍是脑解码领域的主要挑战,其受限因素包括 EEG 的低空间分辨率、神经记录与视频动态之间的时间不匹配,以及对脑活动中语义信息的利用不足。因此,现有方法往往无法充分解决感知视觉刺激的动态连贯性和复杂语义上下文。为克服这些局限,我们提出了 DynaMind,一个通过三个核心模块联合建模神经动态与语义特征来重建视频的新颖框架:区域感知语义映射器(RSM)、时间感知动态对齐器(TDA)和双引导视频重建器(DGVR)。RSM 首先利用区域感知编码器从不同脑区的 EEG 信号中提取多模态语义特征,并将其聚合为统一的扩散先验。同时,TDA 生成动态潜在序列(即蓝图),以强制特征表示与原始神经记录之间的时间一致性。在语义扩散先验的引导下,DGVR 将时间感知蓝图转化为高保真视频重建。在 SEED-DV 数据集上,DynaMind 设立了新的最优性能(SOTA),将重建视频准确率(基于视频和基于帧)分别提升了 12.5 和 10.3 个百分点。它还在像素级质量上实现了飞跃,展现出卓越的视觉保真度和时间连贯性,SSIM 提升了 9.4%,FVMD 降低了 19.7%。这标志着弥合神经动态与高保真视觉语义之间差距的关键进展。

关键词

引用

@article{arxiv.2509.01177,
  title  = {DynaMind: Reconstructing Dynamic Visual Scenes from EEG by Aligning Temporal Dynamics and Multimodal Semantics to Guided Diffusion},
  author = {Junxiang Liu and Junming Lin and Jiangtong Li and Jie Li},
  journal= {arXiv preprint arXiv:2509.01177},
  year   = {2025}
}

备注

14 pages, 6 figures