HAVIR:基于 CLIP 引导的层次化视觉到图像重建
计算机视觉与模式识别
2026-02-05 v2 人工智能
摘要
从脑活动重建视觉信息的能力促进了神经科学与计算机视觉之间的跨学科融合。然而,现有方法仍面临准确恢复高度复杂视觉刺激的挑战。这一困难源于自然场景的特征:低层特征呈异质性,而高层特征因语境重叠而呈语义交织。受视觉皮层层次化表示理论启发,我们提出 HAVIR 模型,将视觉皮层分为两个层次区域,从每个区域提取不同的特征。具体而言,结构生成器从空间处理体素中提取结构信息并转换为潜在扩散先验,而语义提取器将语义处理体素转换为 CLIP 嵌入。这两个组件通过 Versatile Diffusion 模型集成,以合成最终图像。实验结果表明,HAVIR 在结构和语义质量上均有所提升,尤其在复杂场景下,也超越了现有模型。
引用
@article{arxiv.2510.03122,
title = {HAVIR: HierArchical Vision to Image Reconstruction using CLIP-Guided Versatile Diffusion},
author = {Shiyi Zhang and Dong Liang and Hairong Zheng and Yihang Zhou},
journal= {arXiv preprint arXiv:2510.03122},
year = {2026}
}