MindTuner:基于视觉指纹与语义校正的跨被试视觉解码
计算机视觉与模式识别
2024-12-17 v2 多媒体
摘要
从大脑活动中解码自然视觉场景已取得蓬勃发展,在单被试任务中有广泛研究,但在跨被试任务中研究较少。由于被试之间存在深刻的个体差异且数据标注稀缺,在跨被试任务中重建高质量图像是一个极具挑战性的问题。在本工作中,我们提出了用于跨被试视觉解码的 MindTuner,得益于人类视觉系统中视觉指纹现象以及一种新颖的 fMRI 到文本对齐范式,仅需 1 小时的 fMRI 训练数据即可实现高质量且语义丰富的重建。首先,我们在 7 名被试间预训练一个多被试模型,并利用新被试的稀缺数据进行微调,其中采用带有 Skip-LoRAs 的 LoRAs 来学习视觉指纹。随后,我们将图像模态作为中间枢纽模态以实现 fMRI 到文本的对齐,这不仅取得了出色的 fMRI 到文本检索性能,还利用微调后的语义对 fMRI 到图像的重建进行了校正。定性与定量分析结果均表明,无论使用 1 小时还是 40 小时的训练数据,MindTuner 在自然场景数据集(NSD)上均超越了 SOTA 的跨被试视觉解码模型。
引用
@article{arxiv.2404.12630,
title = {MindTuner: Cross-Subject Visual Decoding with Visual Fingerprint and Semantic Correction},
author = {Zixuan Gong and Qi Zhang and Guangyin Bao and Lei Zhu and Ke Liu and Liang Hu and Duoqian Miao},
journal= {arXiv preprint arXiv:2404.12630},
year = {2024}
}
备注
AAAI 2025, 14 pages