基于生成式潜在扩散从 fMRI 信号重建自然场景
计算机视觉与模式识别
2023-06-22 v2 人工智能
神经元与认知
摘要
在神经解码研究中,基于 fMRI 信号重建所感知的自然图像是最引人入胜的课题之一。以往研究已能重建视觉的不同方面,如低层属性(形状、纹理、布局)或高层特征(物体类别、场景描述性语义),但往往难以针对复杂场景图像同时重建这些属性。生成式 AI 近期借助能生成高复杂度图像的潜在扩散模型取得飞跃。本文探究如何利用这一创新技术进行脑解码。我们提出名为“Brain-Diffuser”的两阶段场景重建框架。第一阶段,从 fMRI 信号出发,利用 VDVAE(Very Deep Variational Autoencoder,极深变分自编码器)模型重建捕捉低层属性与整体布局的图像。第二阶段,使用以预测多模态(文本与视觉)特征为条件的潜在扩散模型(Versatile Diffusion)的图像到图像框架,生成最终重建图像。在公开的自然场景数据集(Natural Scenes Dataset)基准上,我们的方法在定性与定量上均优于以往模型。当应用于由个体 ROI(region-of-interest,感兴趣区域)掩码生成的合成 fMRI 模式时,我们所训练模型能创建与神经科学知识一致的令人信服的“ROI 最优”场景。因此,所提方法可对应用(如脑机接口)与基础神经科学均产生影响。
引用
@article{arxiv.2303.05334,
title = {Natural scene reconstruction from fMRI signals using generative latent diffusion},
author = {Furkan Ozcelik and Rufin VanRullen},
journal= {arXiv preprint arXiv:2303.05334},
year = {2023}
}