中文

SynMind:减少基于 fMRI 的图像重建中的语义幻觉

计算机视觉与模式识别 2026-01-27 v1

摘要

近年来,基于 fMRI 的图像重建取得了显著的逼真保真度。然而,一个持续存在的局限性是:尽管重建图像通常看起来很自然且在整体上与目标刺激相似,但它们经常遭受严重的语义错位——尽管视觉质量很高,但显著物体经常被替换或产生幻觉。在本工作中,我们通过重新思考显式语义解释在 fMRI 解码中的作用来解决这一局限性。我们认为,现有方法过于依赖纠缠的视觉嵌入,这些嵌入优先考虑低级外观线索(如纹理和全局概要),而非显式的语义身份。为了克服这一点,我们将 fMRI 信号解析为丰富的、句子级的语义描述,以反映人类视觉理解的层次性与组合性。我们通过利用基于视觉基础的语言模型(VLM)生成合成的、类人的、多粒度的文本表示来捕获物体身份与空间组织,从而实现了这一点。在此基础之上,我们提出了 SynMind,这是一个将这些显式语义编码与视觉先验相结合以调节预训练扩散模型的框架。大量实验表明,SynMind 在大多数定量指标上优于 SOTA 方法。值得注意的是,通过将语义推理卸载到我们的文本对齐模块,SynMind 在使用小得多的 Stable Diffusion 1.4 和单个消费级 GPU 的情况下,超越了基于 SDXL 的竞争方法。大规模人类评估进一步证实,SynMind 生成的重建结果更符合人类视觉感知。神经可视化分析表明,SynMind 调用了更广泛且语义相关性更强的大脑区域,从而减轻了对高级视觉区域的过度依赖。

关键词

引用

@article{arxiv.2601.17857,
  title  = {SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction},
  author = {Lan Yang and Minghan Yang and Ke Li and Honggang Zhang and Kaiyue Pang and Yi-Zhe Song},
  journal= {arXiv preprint arXiv:2601.17857},
  year   = {2026}
}