Atss-Net:基于注意力神经网络的目标说话人分离
音频与语音处理
2020-05-20 v1 声音
摘要
近来,基于卷积神经网络(CNN)与长短期记忆(LSTM)的模型已被引入基于深度学习的目标说话人分离。在本文中,我们在频谱图域提出一种基于注意力神经网络(Atss-Net)用于该任务。与CNN-LSTM架构相比,它使网络能够并行计算各特征间的相关性,并使用更浅的层提取更多特征。实验结果表明,我们的Atss-Net虽仅含一半参数,却取得了优于VoiceFilter的性能。此外,我们所提模型在语音增强中也展现出良好前景。
引用
@article{arxiv.2005.09200,
title = {Atss-Net: Target Speaker Separation via Attention-based Neural Network},
author = {Tingle Li and Qingjian Lin and Yuanyuan Bao and Ming Li},
journal= {arXiv preprint arXiv:2005.09200},
year = {2020}
}
备注
Submitted to Interspeech 2020