中文

脑印记调制的目标说话人提取

声音 2025-09-23 v1 机器学习

摘要

实现神经引导目标说话人提取(Target Speaker Extraction, TSE)的鲁棒且个性化性能,仍是下一代听力助手面临的重大挑战。这主要源于两个因素:EEG 信号在不同会话间的本征非平稳性,以及高的主体间变异性限制了通用模型的有效性。为此,我们提出脑印记调制目标说话人提取(Brainprint-Modulated Target Speaker Extraction, BM-TSE),一种面向个性化高保真提取的新型框架。BM-TSE 首先采用具有自适应频谱增益(Adaptive Spectral Gain, ASG)模块的时空 EEG 编码器,以提取抗非平稳性稳定特征。框架的核心是一种个性化调制机制,在主导主体识别(Subject Identification, SID)和听觉注意解码(Auditory Attention Decoding, AAD)任务的联合监督下学习统一的脑图嵌入。该学习得到的脑图编码了用户的静态特征与动态注意状态,主动细化音频分离过程,动态地将输出量身定制给每个用户。在公开的 KUL 数据集和鸡尾酒派对数据集上进行评估,BM-TSE 实现了最先进的性能,显著优于现有方法。我们的代码已公开访问于:https://github.com/rosshan-orz/BM-TSE。

关键词

引用

@article{arxiv.2509.17883,
  title  = {Brainprint-Modulated Target Speaker Extraction},
  author = {Qiushi Han and Yuan Liao and Youhao Si and Liya Huang},
  journal= {arXiv preprint arXiv:2509.17883},
  year   = {2025}
}

备注

5 pages, 2 figures, conference