可控心智视觉扩散模型
计算机视觉与模式识别
2023-12-19 v3
摘要
大脑信号可视化已成为一个活跃的研究领域,作为人类视觉系统与计算机视觉模型之间的关键接口。尽管扩散模型在分析功能磁共振成像(fMRI)数据方面展现了潜力,包括重建与原始视觉刺激一致的高质量图像,但它们从大脑信号中提取语义和轮廓信息的准确性仍然有限。在这方面,我们提出了一种新方法,称为可控心智视觉扩散模型(CMVDM)。CMVDM 使用属性对齐和辅助网络从 fMRI 数据中提取语义和轮廓信息。此外,引入了残差块以捕获语义和轮廓特征之外的信息。然后,我们利用控制模型充分利用提取的信息进行图像合成,使得生成的图像在语义和轮廓方面与视觉刺激高度相似。通过大量实验,我们证明 CMVDM 在定性和定量上均优于现有的 SOTA 方法。
引用
@article{arxiv.2305.10135,
title = {Controllable Mind Visual Diffusion Model},
author = {Bohan Zeng and Shanglin Li and Xuhui Liu and Sicheng Gao and Xiaolong Jiang and Xu Tang and Yao Hu and Jianzhuang Liu and Baochang Zhang},
journal= {arXiv preprint arXiv:2305.10135},
year = {2023}
}
备注
16 pages, 11 figures