独立特征增强跨模态融合用于语音刺激与EEG响应的匹配-不匹配分类
音频与语音处理
2024-10-22 v1 信号处理
摘要
对于听觉注意力解码,必须通过探索语音刺激与对应EEG响应之间的关系来分类匹配与不匹配的语音刺激。然而,现有方法常采用两个独立网络分别编码语音刺激和EEG响应,忽略了这两种信号之间相互关系。本文提出了一种独立特征增强跨模态融合模型(IFE-CF),用于匹配-不匹配分类,利用语音刺激与EEG响应的融合特征实现听觉EEG解码。具体而言,IFE-CF包含一个跨模态编码器,采用两分支结构并通过跨模态注意力机制进行连接,实现语音刺激和EEG响应的编码;多通道融合模块通过聚合来自跨模态编码器获取的交互特征以及来自语音刺激和EEG响应的独立特征来实现两种模态的特征融合;以及用于给出匹配结果的预测器。此外,引入因果掩码来考虑语音-EEG配对的时间延迟,从而进一步增强匹配-不匹配分类的特征表示。实验结果表明,我们的方法在分类准确率上优于2023年听觉EEG解码挑战赛的基线。
引用
@article{arxiv.2410.15078,
title = {Independent Feature Enhanced Crossmodal Fusion for Match-Mismatch Classification of Speech Stimulus and EEG Response},
author = {Shitong Fan and Wenbo Wang and Feiyang Xiao and Shiheng Zhang and Qiaoxi Zhu and Jian Guan},
journal= {arXiv preprint arXiv:2410.15078},
year = {2024}
}
备注
Shitong Fan and Wenbo Wang contributed equally. Accepted by the International Symposium on Chinese Spoken Language Processing (ISCSLP) 2024