中文

fMRI2GES:基于双脑解码对齐的 fMRI 语音伴随手势重建

人工智能 2025-12-02 v1 机器学习

摘要

理解大脑对外部刺激的反应并解码这一过程一直是神经科学中的重要挑战。虽然以往研究通常聚焦于脑-图像或脑-语言重建,但本文旨在重建与大脑感知的语音刺激相关的手势。然而,缺乏配对的{脑, 语音, 手势}数据阻碍了深度学习模型的应用。本文提出一种新方法,**fMRI2GES**,通过**双脑解码对齐**(Dual Brain Decoding Alignment)实现基于非配对数据的 fMRI 到手势重建网络训练。该方法依赖两个关键组件:(i) 引发大脑反应的观察文本,以及(ii) 与手势关联的文本描述。随后,我们不通过完全监督方式训练模型来寻找三种模态之间的映射关系,而是采用 fMRI 到文本模型、配对数据上的文本到手势模型以及非配对数据上的 fMRI 到手势模型,构建双重 fMRI 到手势重建模式。随后,我们显式对齐两个输出,并以自监督方式训练模型。我们展示了该方法可直接从 fMRI 记录中重建富有表现力的手势。我们还探讨了来自皮层不同区域的 fMRI 信号及其对生成结果的影响。总体而言,我们为解码语音伴随手势提供了新见解,从而推动了神经科学和认知科学的理解。

关键词

引用

@article{arxiv.2512.01189,
  title  = {fMRI2GES: Co-speech Gesture Reconstruction from fMRI Signal with Dual Brain Decoding Alignment},
  author = {Chunzheng Zhu and Jialin Shao and Jianxin Lin and Yijun Wang and Jing Wang and Jinhui Tang and Kenli Li},
  journal= {arXiv preprint arXiv:2512.01189},
  year   = {2025}
}

备注

IEEE Transactions on Circuits and Systems for Video Technology (TCSVT) 2025