BASEN:多说话人条件下具有卷积交叉注意力的时域脑辅助语音增强网络
音频与语音处理
2023-05-18 v1 人工智能
声音
摘要
在多说话人条件下,时域单通道语音增强(SE)由于缺乏目标说话人的任何先验信息,仍难以提取目标说话人。听觉注意解码已表明,听者的脑活动包含其所关注说话人的听觉信息。因此,本文提出一种新颖的时域脑辅助语音增强网络(BASEN),结合从听者记录的脑电图(EEG)信号,从单耳语音混合中提取目标说话人。所提 BASEN 基于全卷积时域音频分离网络。为充分利用 EEG 信号中的互补信息,我们进一步提出一种卷积多层交叉注意力模块来融合双分支特征。在公开数据集上的实验结果表明,所提模型在多项评价指标上优于最先进方法。可复现代码见 https://github.com/jzhangU/Basen.git。
引用
@article{arxiv.2305.09994,
title = {BASEN: Time-Domain Brain-Assisted Speech Enhancement Network with Convolutional Cross Attention in Multi-talker Conditions},
author = {Jie Zhang and Qing-Tian Xu and Qiu-Shi Zhu and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2305.09994},
year = {2023}
}
备注
Submitted to ISCA Interspeech 2023