中文

M3ANet:用于脑辅助目标说话人提取的多尺度与多模态对齐网络

音频与语音处理 2025-06-03 v1 声音

摘要

脑辅助目标说话人提取(TSE)旨在利用大脑神经活动(例如脑电图,EEG)从混合语音中提取被关注的语音。然而,现有模型忽略了语音与 EEG 模态之间的时间不对齐问题,这阻碍了 TSE 的性能。此外,当前模型中的语音编码器通常使用基本的时间操作(例如一维卷积),无法有效提取目标说话人信息。为了解决这些问题,本文提出了一种用于脑辅助 TSE 的多尺度与多模态对齐网络(M3ANet)。具体而言,为了消除 EEG 与语音模态之间的时间不一致性,应用了采用对比学习策略的模态对齐模块来对齐两种模态的时间特征。此外,为了充分提取语音信息,采用带有 GroupMamba 模块的多尺度卷积作为语音编码器,从不同方向扫描每个尺度的语音特征,使模型能够捕获深层序列信息。在三个公开数据集上的实验结果表明,所提出的模型在各种评估指标上均优于当前最先进的方法,突显了我们所提方法的有效性。源代码可在以下地址获取:https://github.com/fchest/M3ANet。

关键词

引用

@article{arxiv.2506.00466,
  title  = {M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction},
  author = {Cunhang Fan and Ying Chen and Jian Zhou and Zexu Pan and Jingjing Zhang and Youdian Gao and Xiaoke Yang and Zhengqi Wen and Zhao Lv},
  journal= {arXiv preprint arXiv:2506.00466},
  year   = {2025}
}

备注

Accepted to IJCAI 2025