LLM4Brain:训练大型语言模型用于脑部视频理解
计算机视觉与模式识别
2024-09-27 v1 人机交互
摘要
从不同受试者的脑信号(如功能磁共振成像)中解码视觉语义信息面临着显著挑战,包括低信噪比、有限的数据可用性和跨受试者变异性。大型语言模型的最新进展在处理多模态信息方面显示出显著的有效性。在本研究中,我们介绍了一种基于大型语言模型的方法,用于从视频刺激诱发的功能磁共振成像信号中重建视觉语义信息。具体来说,我们对配备适配器的功能磁共振成像编码器采用微调技术,将脑响应转换为与视频刺激对齐的潜在表示。随后,这些表示由大型语言模型映射到文本模态。特别地,我们集成了自监督域自适应方法,以增强视觉语义信息与脑响应之间的对齐。我们提出的方法在使用各种定量语义指标时取得了良好结果,同时与真实信息保持了相似性。
引用
@article{arxiv.2409.17987,
title = {LLM4Brain: Training a Large Language Model for Brain Video Understanding},
author = {Ruizhe Zheng and Lichao Sun},
journal= {arXiv preprint arXiv:2409.17987},
year = {2024}
}
备注
ECCV2024 Workshop