中文

基于跨注意力调制网络的 EEG-EMG 融合语音调制解码

声音 2025-11-17 v1 机器学习 神经元与认知

摘要

脑-计算机接口(BCI)语音解码已成为为听力受损者提供帮助的有前景工具。在此背景下,整合脑电图(EEG)和肌电图(EMG)信号具有强大的潜力来增强解码性能。汉语音调分类具有特殊挑战,因为即使音节相同,语调变化也传递不同含义。本研究提出一种新型跨主体多模态 BCI 解码框架,用于在 audible 和 silent 语音条件下对四个汉语音调进行分类。灵感来源于神经和肌肉系统在语音产生中的协同机制,我们的神经解码架构结合了时空特征提取分支和跨注意力融合机制,实现了模态间的讯息交互。我们进一步采用领域对抗训练来提高跨主体泛化能力。我们收集了来自 10 名受试者的 4800 组 EEG 试验和 4800 组 EMG 试验,仅使用 20 个 EEG 通道和 5 个 EMG 通道,展示了最小通道解码的可行性。尽管采用轻量模块,本模型在所有条件下均优于最先进的基线,实现 audible 语音的平均分类准确率为 87.83%,silent 语音为 88.08%。在跨主体评估中, audible 语音和 silent 语音的准确率分别为 83.27% 和 85.10%。我们进一步进行消融研究以验证每个组件的有效性。我们的发现表明,利用最小 EEG-EMG 通道进行调制级解码是可行的且可能跨主体可泛化,为开发实用 BCI 应用作出贡献。

关键词

引用

@article{arxiv.2511.10935,
  title  = {CAT-Net: A Cross-Attention Tone Network for Cross-Subject EEG-EMG Fusion Tone Decoding},
  author = {Yifan Zhuang and Calvin Huang and Zepeng Yu and Yongjie Zou and Jiawei Ju},
  journal= {arXiv preprint arXiv:2511.10935},
  year   = {2025}
}

备注

This is the extended version with technical appendices. The version of record appears in AAAI-26. Please cite the AAAI version