GASS:利用大规模数据泛化音频源分离
声音
2023-10-03 v1 人工智能
机器学习
音频与语音处理
信号处理
摘要
通用源分离旨在分离任意混合的音频源,去除仅在特定域(如语音或音乐)上操作的约束。然而,通用源分离的潜力受限,因为大多数现有工作聚焦于以声音事件为主的混合,且较小的训练数据集也限制了其监督学习的潜力。在此,我们研究一个单一通用音频源分离(GASS)模型,该模型以监督方式利用大规模数据集训练以分离语音、音乐和声音事件。我们在一组多样化任务上评估GASS模型。我们强劲的分布内结果显示了GASS模型的可行性,而在声音事件与语音分离中具竞争力的分布外表现显示了其泛化能力。然而,GASS模型难以泛化以分离分布外的电影与音乐内容。我们还在每个数据集上微调GASS模型,并一致优于无预训练的模型。所有微调模型(除音乐分离模型外)在各自基准中均取得最先进(SOTA)结果。
引用
@article{arxiv.2310.00140,
title = {GASS: Generalizing Audio Source Separation with Large-scale Data},
author = {Jordi Pons and Xiaoyu Liu and Santiago Pascual and Joan Serrà},
journal= {arXiv preprint arXiv:2310.00140},
year = {2023}
}