EIT-1M:用于人类视觉-文字识别的百万级EEG图像-文本对
计算机视觉与模式识别
2024-07-03 v1 人机交互
摘要
最近,电子脑电图(EEG)信号被积极融入以解码大脑活动以实现视觉或文字刺激的感知,以及在多模态AI中实现对象识别。因此,研究者致力于构建来自视觉或文字单模态刺激的EEG数据集。然而,这些数据集每个类别的EEG时段有限,且呈现给参与者的刺激的复杂语义会妨碍其捕捉精确脑区活动的质量与保真度。神经科学领域的研究揭示,视觉和文字刺激在EEG记录中的关系为理解大脑同时处理多模态信息的能力提供了宝贵的见解。灵感来自此发现,本文提出一种新型大规模多模态数据集,命名为EIT-1M,包含超过百万对EEG-图像-文本。该数据集在反映同时处理多模态信息的脑区活动方面具有优势。为实现此目标,我们在参与者观看交替序列的视觉-文字刺激期间收集数据对,这些刺激来自6万张自然图像和类别特定文本。同时包括常见语义类别以更好地激发参与者大脑的反应。此外,包括基于响应的刺激时序和跨块/跨会话的重复,以确保数据多样性。为验证EIT-1M的有效性,我们对来自不同类别和参与者的多模态刺激所捕获的EEG数据进行深入分析,提供数据质量分数以提高透明度。我们在两个任务上展示了其有效性:1)从视觉或文字刺激或两者的EEG识别,以及2)EEG到视觉生成。
引用
@article{arxiv.2407.01884,
title = {EIT-1M: One Million EEG-Image-Text Pairs for Human Visual-textual Recognition and More},
author = {Xu Zheng and Ling Wang and Kanghao Chen and Yuanhuiyi Lyu and Jiazhou Zhou and Lin Wang},
journal= {arXiv preprint arXiv:2407.01884},
year = {2024}
}