AnyAccomp:通过量化旋律瓶颈实现通用伴奏生成
声音
2025-09-18 v1 信号处理
摘要
演唱伴奏生成(SAG)是为给定干净人声输入生成器乐伴奏的过程。然而,现有SAG技术使用源分离的人声作为输入,并对分离伪影过拟合。这导致与干净、真实世界人声输入之间的严重训练-测试不匹配,引发性能失效。我们引入AnyAccomp框架,通过解耦源依赖伪影来解决此问题。AnyAccomp首先采用量化旋律瓶颈,利用色谱图和VQ-VAE提取核心旋律的离散且不依赖音色的表示。随后,基于这些稳健的代码,flow-matching模型生成条件伴奏。实验表明,AnyAccomp在分离人声基准测试上实现了与现有方法相当的性能,同时在干净录音棚人声和显著优于基线的单声部乐器测试集上表现显著提升。这一工作在通用性方面实现了质的飞跃,使伴奏生成能够为乐器提供稳健的支持——而现有模型在此类任务中完全失效——为更灵活的音乐共创工具铺平了道路。演示音频和代码:https://anyaccomp.github.io
引用
@article{arxiv.2509.14052,
title = {AnyAccomp: Generalizable Accompaniment Generation via Quantized Melodic Bottleneck},
author = {Junan Zhang and Yunjia Zhang and Xueyao Zhang and Zhizheng Wu},
journal= {arXiv preprint arXiv:2509.14052},
year = {2025}
}
备注
Demo audio and code: https://anyaccomp.github.io