超越大脑之见:基于稀疏掩码建模的条件扩散模型用于视觉解码
计算机视觉与模式识别
2023-03-30 v3
摘要
从脑记录中解码视觉刺激旨在加深我们对人类视觉系统的理解,并为通过脑机接口连接人类视觉与计算机视觉奠定坚实基础。然而,由于脑信号潜在的复杂表征以及数据标注的稀缺,从脑记录中重建具有正确语义的高质量图像是一个具有挑战性的问题。在本工作中,我们提出 MinD-Vis:用于人类视觉解码的带双条件潜扩散模型的稀疏掩码脑建模。首先,受初级视觉皮层中信息稀疏编码的启发,我们在大潜空间中使用掩码建模学习 fMRI 数据的有效自监督表征。然后通过对潜扩散模型进行双条件增强,我们展示了 MinD-Vis 能够利用极少量配对标注从脑记录中重建具有语义匹配细节的高度可信图像。我们从定性与定量两方面对模型进行基准测试;实验结果表明,我们的方法在语义映射(100 类语义分类)和生成质量(FID)上分别比最先进水平高出 66% 和 41%。我们还进行了详尽的消融研究以分析我们的框架。
引用
@article{arxiv.2211.06956,
title = {Seeing Beyond the Brain: Conditional Diffusion Model with Sparse Masked Modeling for Vision Decoding},
author = {Zijiao Chen and Jiaxin Qing and Tiange Xiang and Wan Lin Yue and Juan Helen Zhou},
journal= {arXiv preprint arXiv:2211.06956},
year = {2023}
}
备注
8 pages, 9 figures, 2 tables, accepted by CVPR2023, see https://mind-vis.github.io/ for more information