面向高保真视觉重建:从基于EEG的条件生成到联合模态引导重建
计算机视觉与模式识别
2026-03-23 v1 人工智能
摘要
人类视觉重建旨在基于受试者提供的描述和相应的神经信号来重建细粒度的视觉刺激。作为一种广泛采用的模态,脑电图(EEG)捕获了丰富的视觉认知信息,涵盖场景中复杂的空间关系和色彩细节。然而,当前方法与一种强制EEG特征与文本或图像语义表示对齐的框架紧密耦合。这种依赖可能会压缩EEG中丰富的空间和色彩细节,仅实现条件图像生成而非高保真视觉重建。为解决这一局限性,我们提出了一种新的联合模态视觉重建(JMVR)框架。该框架将EEG和文本视为独立的模态进行联合学习,以保留EEG特有的重建信息。进一步采用多尺度EEG编码策略捕获细粒度和粗粒度特征,同时通过图像增强来提高感知细节的恢复。在THINGS-EEG数据集上的大量实验表明,JMVR在六个基线方法中实现了SOTA性能,特别在建模空间结构和色彩保真度方面表现优异。
引用
@article{arxiv.2603.19667,
title = {Toward High-Fidelity Visual Reconstruction: From EEG-Based Conditioned Generation to Joint-Modal Guided Rebuilding},
author = {Zhijian Gong and Tianren Yao and Wenjia Dong and Xueyuan Xu},
journal= {arXiv preprint arXiv:2603.19667},
year = {2026}
}