ConSep:通过幅度条件实现噪声和混响鲁棒的语音分离框架
声音
2024-03-05 v1 音频与语音处理
摘要
语音分离最近由于时域方法中使用的细粒度视觉而取得了显著进展。然而,一些研究表明,在遇到更严苛的条件(如噪声或混响)时,采用短时傅里叶变换(STFT)进行特征提取可能是有益的。因此,我们提出了一个幅度条件的时域框架ConSep,以继承这些有益特性。实验表明,与两种著名方法SepFormer和Bi-Sep相比,ConSep在消声、噪声和混响环境中提升了性能。此外,我们可视化了ConSep的组件,以强化优势并与我们在初步研究中发现的实际情况保持一致。
引用
@article{arxiv.2403.01792,
title = {ConSep: a Noise- and Reverberation-Robust Speech Separation Framework by Magnitude Conditioning},
author = {Kuan-Hsun Ho and Jeih-weih Hung and Berlin Chen},
journal= {arXiv preprint arXiv:2403.01792},
year = {2024}
}