GSEP:一种采用门控CBHG模块与响度归一化的鲁棒人声与伴奏分离系统
声音
2021-02-23 v2 多媒体
音频与语音处理
摘要
在音频信号处理研究领域,源分离长期是热门研究课题,且深度神经网络近期的采用显著提升了性能。该提升促使产业界将基于音频深度学习的产品与服务(包括音乐流媒体应用中的卡拉OK和UHDTV中的对话增强)产品化。针对这些早期市场,我们从鲁棒性、质量与成本三方面定义了人声与伴奏分离模型的一组设计原则。本文介绍GSEP(Gaudio源分离系统),一种采用门控CBHG模块、掩码扭曲与响度归一化的鲁棒人声与伴奏分离系统,并验证所提系统满足全部三项原则,且在客观指标与主观评估上均优于最先进(SOTA)系统。
引用
@article{arxiv.2010.12139,
title = {GSEP: A robust vocal and accompaniment separation system using gated CBHG module and loudness normalization},
author = {Soochul Park and Ben Sangbae Chon},
journal= {arXiv preprint arXiv:2010.12139},
year = {2021}
}
备注
5 pages, 5 figures