MBTFNet:用于歌声增强的多频带时频神经网络
声音
2023-10-09 v1 机器学习
音频与语音处理
摘要
典型的神经语音增强(SE)方法主要处理语音与噪声的混合,对于歌声增强场景并非最优。音乐源分离(MSS)模型将人声与各种伴奏成分同等对待,与仅考虑人声增强的模型相比可能降低性能。本文提出一种新颖的多频带时频神经网络(MBTFNet)用于歌声增强,专门从歌唱录音中去除背景音乐、噪声甚至伴唱人声。MBTFNet结合带间与带内建模以更好地处理全频带信号。引入双路径建模以扩展模型的感受野。我们提出基于信噪比(SNR)估计的隐式个性化增强(IPE)阶段,进一步提升了MBTFNet的性能。实验表明,我们提出的模型显著优于多个最先进的SE和MSS模型。
引用
@article{arxiv.2310.04369,
title = {MBTFNet: Multi-Band Temporal-Frequency Neural Network For Singing Voice Enhancement},
author = {Weiming Xu and Zhouxuan Chen and Zhili Tan and Shubo Lv and Runduo Han and Wenjiang Zhou and Weifeng Zhao and Lei Xie},
journal= {arXiv preprint arXiv:2310.04369},
year = {2023}
}