DecoFuse: 分解并融合“是什么”、“在哪里”与“如何”用于脑类比fMRI到视频解码
计算机视觉与模式识别
2025-04-02 v1
摘要
从脑活动解码视觉经验是一项重大挑战。现有fMRI到视频方法通常仅关注语义内容,忽视了空间和运动信息。然而,这些方面在大脑中经由不同通路加工。为此,我们提出DecoFuse——一种新颖的脑类比框架,用于从fMRI信号解码视频。该框架首先将视频分解为三个组成部分——语义、空间和运动——然后分别解码每个组件,再融合以重建视频。这种方法不仅通过将复杂的视频解码任务分解为可管理的子任务来简化任务,还通过脱敏实验建立了学习表示与其生物学对应关系之间的更清晰的联系。进一步的实验表明,DecoFuse显著优于先前的状态方法,实现了82.4%的语义分类准确率、70.6%的空间一致性准确率、0.212的余弦相似度用于运动预测,以及21.9%的50分类视频生成准确率。此外,针对语义和空间信息的神经编码分析与双通路假说相吻合,进一步验证了视缘和动缘通路的不同作用。总体而言,DecoFuse为fMRI到视频解码提供了一个强大且具有生物学合理性的框架。项目页面: https://chongjg.github.io/DecoFuse/。
引用
@article{arxiv.2504.00432,
title = {DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding},
author = {Chong Li and Jingyang Huo and Weikang Gong and Yanwei Fu and Xiangyang Xue and Jianfeng Feng},
journal= {arXiv preprint arXiv:2504.00432},
year = {2025}
}