中文

UniBrain:从人脑活动统一图像重建与字幕生成于单一扩散模型

计算机视觉与模式识别 2023-08-16 v1 人工智能

摘要

由视觉刺激引发的大脑活动进行图像重建与字幕生成,使研究者能进一步理解人脑与视觉感知系统之间的联系。尽管深度生成模型近来已应用于该领域,重建兼具低层细节与高语义保真度的真实字幕与图像仍是一个挑战性问题。在本工作中,我们提出UniBrain:从人脑活动统一图像重建与字幕生成于单一扩散模型。我们首次通过称为Versatile Diffusion的潜在扩散模型,统一了由视觉诱发功能磁共振成像(fMRI)进行的图像重建与字幕生成。具体而言,我们将fMRI体素转换为文本与图像潜在以提取低层信息,并通过源自CLIP的基于fMRI的图像与文本条件引导反向扩散过程,生成真实字幕与图像。UniBrain在图像重建上定性与定量均优于当前方法,并首次在Natural Scenes Dataset(NSD)数据集上报告了图像字幕生成结果。此外,消融实验与功能感兴趣区(ROI)分析进一步展示了UniBrain的优越性,并为视觉诱发大脑解码提供了全面洞见。

关键词

引用

@article{arxiv.2308.07428,
  title  = {UniBrain: Unify Image Reconstruction and Captioning All in One Diffusion Model from Human Brain Activity},
  author = {Weijian Mai and Zhijun Zhang},
  journal= {arXiv preprint arXiv:2308.07428},
  year   = {2023}
}