一种无须分枝的单解码器系统,用于超越四声部的音乐源分离
声音
2024-08-27 v2 人工智能
信息检索
机器学习
音频与语音处理
摘要
尽管近期在音乐源分离的多个子任务上取得了显著进展,但鲜有音乐源分离系统支持超过四声部(人声、鼓乐、贝斯及其他,简称VDBO)的分离。目前支持超出此设置的极少数系统大多仍依赖固定且不可扩展的解码器配置,只能支持预定义的固定声部集合。增加声部支持会相应增加计算复杂度,使得这些系统对长尾乐器的扩展在计算上不可行。本文提出了Banquet系统,允许使用单个解码器进行多声部源分离。将声道分割源分离模型扩展到查询基的设置,搭配音乐乐器识别PaSST模型使用。实验表明,Banquet仅需24.9万可训练参数,即可媲美计算复杂度更高的6声部混合变换Demucs在VDBO声部上的表现,并在吉他和钢琴上超越其性能。查询基的设置允许分离狭窄的乐器类别,如干净的民族吉他,成功应用于提取不常见的声部,如管乐和管风琴。实现代码已公开于https://github.com/kwatcharasupat/query-bandit。
引用
@article{arxiv.2406.18747,
title = {A Stem-Agnostic Single-Decoder System for Music Source Separation Beyond Four Stems},
author = {Karn N. Watcharasupat and Alexander Lerch},
journal= {arXiv preprint arXiv:2406.18747},
year = {2024}
}
备注
Accepted to the 25th International Society for Music Information Retrieval Conference (ISMIR 2024). Camera-ready version