音乐源分离的集成方法:传统与分层音轨分离的比较分析
声音
2024-10-29 v1 机器学习
音频与语音处理
摘要
音乐源分离(MSS)是一项从混合音频信号中分离出单个声源或音轨的任务。本文提出了一种用于 MSS 的集成方法,结合了多种 state-of-the-art 架构,以在传统的人声、鼓声和贝斯(VDB)音轨上实现卓越的分离性能,并扩展到对底鼓、军鼓、主唱和背景人声等子音轨进行第二级分层分离。我们的方法利用各种模型的互补优势,克服了依赖单一模型的局限性,从而在各音轨上获得更均衡的结果。对于音轨选择,我们使用了信噪比(SNR)和信号失真比(SDR)的调和平均值,确保极值不会使结果产生偏差,并且两个指标都得到有效加权。除了在 VDB 音轨上始终保持高性能外,我们还探索了第二级分层分离,揭示了 MSS 复杂性的重要见解,以及流派和乐器编排等因素如何影响模型性能。尽管第二级分离结果表明仍有改进空间,但分离子音轨的能力标志着一重大进展。我们的发现为 MSS 的进一步研究铺平了道路,特别是在扩展模型超越 VDB 的能力以及改进吉他和钢琴等小众音轨分离方面。
引用
@article{arxiv.2410.20773,
title = {An Ensemble Approach to Music Source Separation: A Comparative Analysis of Conventional and Hierarchical Stem Separation},
author = {Saarth Vardhan and Pavani R Acharya and Samarth S Rao and Oorjitha Ratna Jasthi and S Natarajan},
journal= {arXiv preprint arXiv:2410.20773},
year = {2024}
}