隐空间自回归源分离
机器学习
2023-01-23 v1 声音
音频与语音处理
摘要
自回归模型在生成质量和下游任务性能方面已在广泛领域中取得令人印象深刻的成果。在连续域中,这一成功背后的关键因素之一是使用量化隐空间(例如通过 VQ-VAE 自编码器获得),其可实现降维并加快推理速度。然而,使用现有的预训练模型执行新的非平凡任务是困难的,因为这需要额外的微调或大量训练以引出提示。本文提出 LASS,作为一种执行向量量化隐空间自回归源分离(即将输入信号去混合为其组成源)的方法,无需额外的基于梯度的优化或修改现有模型。我们的分离方法依赖于贝叶斯公式,其中自回归模型为先验,并通过在加数 token 的隐空间和上执行频率计数来构造离散(非参数)似然函数。我们在图像和音频上以若干采样策略(例如祖先采样、束搜索)测试了我们的方法,在分离质量方面展现出与现有方法相当的结果,同时在推理时间和向更高维数据可扩展性方面提供了显著的加速。
引用
@article{arxiv.2301.08562,
title = {Latent Autoregressive Source Separation},
author = {Emilian Postolache and Giorgio Mariani and Michele Mancusi and Andrea Santilli and Luca Cosmo and Emanuele Rodolà},
journal= {arXiv preprint arXiv:2301.08562},
year = {2023}
}
备注
Accepted to AAAI 2023