用于干声歌声分离的神经网络声码器特征估计
声音
2022-11-30 v1 音频与语音处理
摘要
歌声分离(SVS)是一项将歌声音频从其与伴奏音频的混合中分离出来的任务。以往的 SVS 研究主要采用频谱图掩码方法,该方法在预测二值掩码时需要很大的维度。此外,它们侧重于提取保留混响效果的湿声人声干声(wet sound)的声部,这一结果可能阻碍分离歌声的复用性。本文通过从混合音频中预测干声歌声的梅尔频谱图作为神经网络声码器特征,并从该神经声码器合成歌声波形,来解决这些问题。我们尝试了两种分离方法:一种是在梅尔频谱图域中预测二值掩码,另一种是直接预测梅尔频谱图。此外,我们加入了歌声检测器以更明确地识别随时间变化的歌声片段。我们从音频、去混响、分离和整体质量方面衡量了模型性能。结果表明,除音频质量外,我们提出的模型在客观和主观评价上均优于最先进的歌声分离模型。
引用
@article{arxiv.2211.15948,
title = {Neural Vocoder Feature Estimation for Dry Singing Voice Separation},
author = {Jaekwon Im and Soonbeom Choi and Sangeon Yong and Juhan Nam},
journal= {arXiv preprint arXiv:2211.15948},
year = {2022}
}
备注
6 pages, 4 figures