一种用于从脑部记录中非侵入性解码口语文本的多模态大语言模型
神经元与认知
2024-10-01 v1 计算与语言
机器学习
声音
音频与语音处理
信号处理
定量方法
摘要
人工智能中与大脑相关的研究课题最近越来越受欢迎,特别是由于多模态架构的能力从计算机视觉扩展到自然语言处理。我们在这项工作中的主要目标是探索这些架构在从非侵入性fMRI记录中解码口语文本方面的可能性和局限性。与视觉和文本数据相反,fMRI数据由于脑部扫描仪的多样性而代表了一种复杂的模态,这意味着(i)记录信号格式的多样性,(ii)原始信号的低分辨率和噪声,以及(iii)可作为生成学习基础模型的预训练模型的稀缺性。这些点使得从fMRI记录中非侵入性解码文本的问题非常具有挑战性。在本文中,我们提出了一种端到端的用于从fMRI信号解码口语文本的多模态大语言模型。所提出的架构基于(i)一个源自特定Transformer的编码器,该编码器包含一个增强的嵌入层和一个比现有技术中调整得更好的注意力机制,以及(ii)一个冻结的大语言模型,该模型被调整为对齐输入文本的嵌入和大脑活动的编码嵌入,以解码输出文本。在一个包含一组人-人和人-机器人交互的语料库上进行了基准测试,其中fMRI和对话信号被同步记录。获得的结果非常有前景,因为我们的提议优于评估的模型,并且能够生成捕捉到真实情况中更准确语义的文本。实现代码可在https://github.com/Hmamouche/brain_decode获取。
引用
@article{arxiv.2409.19710,
title = {A multimodal LLM for the non-invasive decoding of spoken text from brain recordings},
author = {Youssef Hmamouche and Ismail Chihab and Lahoucine Kdouri and Amal El Fallah Seghrouchni},
journal= {arXiv preprint arXiv:2409.19710},
year = {2024}
}
备注
15 pages, 4 figures