中文

MindDiffuser:基于语义与结构扩散从人脑活动可控重建图像

计算机视觉与模式识别 2023-03-27 v1 人工智能

摘要

从测得的功能磁共振成像(fMRI)中重建视觉刺激是一项有意义且具有挑战性的任务。以往研究已成功实现了与原图像结构相似的重建,例如一些自然图像的轮廓和大小。然而,这些重建缺乏明确的语义信息且难以辨认。近年来,许多研究利用具有更强生成能力的多模态预训练模型来重建与原图像语义相似的图像。然而,这些图像具有不可控的结构信息,如位置和方向。为同时解决上述两个问题,我们提出了一种称为 MindDiffuser 的两阶段图像重建模型,利用 Stable Diffusion。在第 1 阶段,将从 fMRI 解码的 VQ-VAE 潜表示和 CLIP 文本嵌入放入 Stable Diffusion 的图生图过程,得到包含语义和结构信息的初步图像。在第 2 阶段,我们利用从 fMRI 解码的低层 CLIP 视觉特征作为监督信息,并通过反向传播持续调整第 1 阶段中的两个特征以对齐结构信息。定性和定量分析的结果表明,我们提出的模型在 Natural Scenes Dataset (NSD) 的重建结果上超越了当前最先进的模型。此外,消融实验的结果表明我们模型的每个组件对图像重建都是有效的。

关键词

引用

@article{arxiv.2303.14139,
  title  = {MindDiffuser: Controlled Image Reconstruction from Human Brain Activity with Semantic and Structural Diffusion},
  author = {Yizhuo Lu and Changde Du and Dianpeng Wang and Huiguang He},
  journal= {arXiv preprint arXiv:2303.14139},
  year   = {2023}
}