SpikeVAEDiff:基于 VD-VAE 与 Versatile Diffusion 的神经脉冲自然视觉场景重建
计算机视觉与模式识别
2026-01-15 v1 人工智能
摘要
从神经活动中重建自然视觉场景是神经科学和计算机视觉领域的一项关键挑战。我们提出了 SpikeVAEDiff,一个新颖的两阶段框架,它结合了极深变分自编码器(VDVAE)和 Versatile Diffusion 模型,以从神经脉冲数据生成高分辨率且语义有意义的图像重建。在第一阶段,VDVAE 通过将神经脉冲信号映射到潜在表示来生成低分辨率的初步重建。在第二阶段,回归模型将神经脉冲信号映射到 CLIP-Vision 和 CLIP-Text 特征,使 Versatile Diffusion 能够通过图像到图像生成来细化图像。我们在 Allen Visual Coding-Neuropixels 数据集上评估了我们的方法,并分析了不同的大脑区域。我们的结果表明,VISI 区域表现出最显著的激活,并在重建质量中发挥关键作用。我们展示了成功和失败的重建示例,反映了神经活动解码的挑战。与基于 fMRI 的方法相比,脉冲数据提供了更优越的时间和空间分辨率。我们进一步验证了 VDVAE 模型的有效性,并进行了消融研究,证明来自特定大脑区域的数据显著增强了重建性能。
引用
@article{arxiv.2601.09213,
title = {SpikeVAEDiff: Neural Spike-based Natural Visual Scene Reconstruction via VD-VAE and Versatile Diffusion},
author = {Jialu Li and Taiyan Zhou},
journal= {arXiv preprint arXiv:2601.09213},
year = {2026}
}
备注
Preprint