面向神经导向目标说话人提取的改进特征提取网络
声音
2025-01-06 v1 音频与语音处理
摘要
近年来听觉注意力解码(AAD)的快速发展使得使用脑电图(EEG)作为目标说话人提取的辅助信息成为可能。然而,有效地对长语音序列进行建模并从 EEG 信号中解析目标说话人身份仍然是一个重大挑战。在本文中,我们提出了一种用于神经导向目标说话人提取的改进特征提取网络(IFENet),它主要由具有双路径 Mamba 的语音编码器和具有 Kolmogorov-Arnold Networks(KAN)的 EEG 编码器组成。我们提出了 SpeechBiMamba,它利用双路径 Mamba 对局部和全局语音序列进行建模以提取语音特征。此外,我们提出了 EEGKAN,以有效提取与听觉刺激密切相关的 EEG 特征,并通过受试者的注意力信息定位目标说话人。在 KUL 和 AVED 数据集上的实验表明,IFENet 优于 SOTA 模型,在开放评估条件下,尺度不变信号失真比(SI-SDR)分别实现了 36% 和 29% 的相对提升。
引用
@article{arxiv.2501.01673,
title = {Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction},
author = {Cunhang Fan and Youdian Gao and Zexu Pan and Jingjing Zhang and Hongyu Zhang and Jie Zhang and Zhao Lv},
journal= {arXiv preprint arXiv:2501.01673},
year = {2025}
}
备注
accepted by ICASSP2025