中文

利用残差量化变分自编码器进行多源原始音乐源分离

声音 2024-08-14 v1 机器学习 多媒体 音频与语音处理

摘要

我开发了一种基于残差量化变分自编码器架构的神经音频编解码器模型。我在 Slakh2100 数据集上训练该模型,Slakh2100 是音乐源分离的标准数据集,由多轨音频组成。该模型能够分离音频源,以更少的计算资源实现了接近最先进 (SoTA) 的结果。代码在 github.com/LeonardoBerti00/Source-Separation-of-Multi-source-Music-using-Residual-Quantizad-Variational-Autoencoder 公开获取。

关键词

引用

@article{arxiv.2408.07020,
  title  = {Source Separation of Multi-source Raw Music using a Residual Quantized Variational Autoencoder},
  author = {Leonardo Berti},
  journal= {arXiv preprint arXiv:2408.07020},
  year   = {2024}
}

备注

9 pages