Lite-Mind:迈向高效且鲁棒的脑表征网络
计算机视觉与模式识别
2024-08-02 v4 人工智能
摘要
fMRI 信号的有限数据可用性和低信噪比导致 fMRI 到图像检索成为一项具有挑战性的任务。最先进的 MindEye 通过利用一个大模型(即每个受试者 996M 参数的 MLP 主干网络),将 fMRI 嵌入对齐到 CLIP 的 Vision Transformer (ViT) 的最终隐藏层,显著提升了 fMRI 到图像检索的性能。然而,即使在相同的实验设置下,受试者之间也存在显著的个体差异,因此必须训练特定于受试者的大型模型。庞大的参数量给在实际设备上部署 fMRI 解码带来了巨大挑战。为此,我们提出了 Lite-Mind,一种基于离散傅里叶变换(DFT)的轻量、高效且鲁棒的脑表征学习范式,该范式能高效地将 fMRI 体素对齐到 CLIP 的细粒度信息。我们精心设计了一个包含频谱压缩和频率投影模块的 DFT 主干网络,以学习信息丰富且鲁棒的体素嵌入。我们的实验表明,Lite-Mind 在 NSD 数据集的受试者 1 上实现了令人瞩目的 94.6% 的 fMRI 到图像检索准确率,且参数量比 MindEye 减少了 98.7%。Lite-Mind 还被证明能够迁移到更小的 fMRI 数据集,并在 GOD 数据集上创造了零样本分类的新 SOTA。
关键词
引用
@article{arxiv.2312.03781,
title = {Lite-Mind: Towards Efficient and Robust Brain Representation Network},
author = {Zixuan Gong and Qi Zhang and Guangyin Bao and Lei Zhu and Ke Liu and Liang Hu and Duoqian Miao and Yu Zhang},
journal= {arXiv preprint arXiv:2312.03781},
year = {2024}
}
备注
17 pages, ACM MM 2024 Oral