用于歌声分离的复比值掩蔽方法
音频与语音处理
2020-11-05 v1 声音
摘要
音乐源分离对于如卡拉OK和重新混音等应用十分重要。以往许多研究聚焦于估计短时傅里叶变换(STFT)幅度并丢弃相位信息。我们观察到,对于歌声分离,相位可显著提升分离质量。本文提出一种用于人声与伴奏分离的复比值掩蔽方法。所提方法采用带自注意力的DenseUNet估计各声源STFT的实部与虚部。引入一种简单的集成技术以进一步提升分离性能。评估结果表明,所提方法在分离人声与伴奏上均优于近期最先进的模型。
引用
@article{arxiv.2011.02008,
title = {Complex ratio masking for singing voice separation},
author = {Yixuan Zhang and Yuzhou Liu and DeLiang Wang},
journal= {arXiv preprint arXiv:2011.02008},
year = {2020}
}