中文

通过细粒度文本桥接改进脑到图像重建

计算机视觉与模式识别 2025-05-30 v2 计算与语言

摘要

脑到图像重建旨在从大脑活动中恢复人类感知到的视觉刺激。然而,重建的视觉刺激往往缺失细节并存在语义不一致,这可能归因于语义信息不足。为了解决这个问题,我们提出了一种名为细粒度脑到图像重建(Fine-grained Brain-to-Image reconstruction, FgB2I)的方法,该方法采用细粒度文本作为桥梁来改进图像重建。FgB2I 包含三个关键阶段:细节增强、细粒度文本描述解码以及文本桥接的脑到图像重建。在细节增强阶段,我们利用大型视觉语言模型为视觉刺激生成细粒度描述,并通过实验验证了其重要性。我们提出了三个奖励指标(对象准确率、文本-图像语义相似度和图像-图像语义相似度),以指导语言模型从 fMRI 信号中解码细粒度文本描述。细粒度文本描述可以集成到现有的重建方法中,以实现细粒度的脑到图像重建。

关键词

引用

@article{arxiv.2505.22150,
  title  = {Improving Brain-to-Image Reconstruction via Fine-Grained Text Bridging},
  author = {Runze Xia and Shuo Feng and Renzhi Wang and Congchi Yin and Xuyun Wen and Piji Li},
  journal= {arXiv preprint arXiv:2505.22150},
  year   = {2025}
}

备注

CogSci2025