资源受限下的立体声歌声消除
声音
2024-01-23 v1 机器学习
音频与语音处理
摘要
我们研究立体声歌声消除问题,这是音乐源分离的一个子任务,其目标是从立体声混音中估计出器乐背景。我们探索如何从一个用于实时语音分离的小型高效模型出发,实现与大型最先进源分离网络相近的性能。当内存和计算资源有限,且歌声处理必须在有限的前瞻量下运行时,这种模型非常有用。在实践中,这是通过调整现有的单声道模型以处理立体声输入来实现的。通过调整模型参数和扩展训练集,我们获得了质量上的提升。此外,我们通过引入一种检测通道间衰减不一致性的新指标,突显了立体声模型带来的好处。我们使用客观离线指标和大规模MUSHRA听力测试评估了我们的方法,在严格的听力测试中证实了我们技术的有效性。
引用
@article{arxiv.2401.12068,
title = {Resource-constrained stereo singing voice cancellation},
author = {Clara Borrelli and James Rae and Dogac Basaran and Matt McVicar and Mehrez Souden and Matthias Mauch},
journal= {arXiv preprint arXiv:2401.12068},
year = {2024}
}