中文

通过风格迁移进行上混音:用于解耦空间意象与音乐内容的可变分自编码器

音频与语音处理 2022-03-24 v1 声音

摘要

在音乐立体声到多声道的上混音问题中,主要任务之一是在多声道渲染结果中设定乐器声源的方向性。本文提出一种改进的可变分自编码器模型,该模型学习一个潜空间以描述多声道音乐中的空间意象。我们力求解耦空间意象与音乐内容,使得所学潜变量对音乐保持不变。在测试时,我们利用潜变量来控制声源的声像定位。我们提出两种上混音用例:将空间意象从一首歌曲迁移到另一首,以及基于生成模型的盲声像定位。我们给出了客观与主观评估结果,经验性地表明我们的模型将空间意象与音乐内容分离捕获,并实现了基于迁移的交互式声像定位。

关键词

引用

@article{arxiv.2203.12053,
  title  = {Upmixing via style transfer: a variational autoencoder for disentangling spatial images and musical content},
  author = {Haici Yang and Sanna Wager and Spencer Russell and Mike Luo and Minje Kim and Wontak Kim},
  journal= {arXiv preprint arXiv:2203.12053},
  year   = {2022}
}