3S-TSE:面向实时和低资源应用的高效三阶段目标说话人提取
声音
2024-01-08 v2 音频与语音处理
摘要
目标说话人提取(TSE)旨在依靠注册样本从多个混合说话人中分离出特定语音。由于声纹特征通常变化很大,当前的端到端神经网络需要大量的模型参数,计算密集,不适用于实时应用,尤其是在资源受限的平台上。在本文中,我们利用麦克风阵列处理 TSE 任务,并引入一种新颖的三阶段解决方案,系统性地解耦该过程:首先,训练一个神经网络来估计目标说话人的方向。其次,在确定方向后,使用广义旁瓣消除器(Generalized Sidelobe Canceller, GSC)提取目标语音。第三,一个原位卷积循环神经网络(Inplace Convolutional Recurrent Neural Network, ICRN)作为去噪后处理器,精炼 GSC 的输出以产生最终分离的语音。我们的方法在提供卓越性能的同时大幅降低了计算负荷,为高效的实时目标说话人提取设立了新标准。
引用
@article{arxiv.2312.10979,
title = {3S-TSE: Efficient Three-Stage Target Speaker Extraction for Real-Time and Low-Resource Applications},
author = {Shulin He and Jinjiang liu and Hao Li and Yang Yang and Fei Chen and Xueliang Zhang},
journal= {arXiv preprint arXiv:2312.10979},
year = {2024}
}
备注
Accepted to ICASSP 2024