用于多对多乐器音色迁移的调制变分自编码器
声音
2018-10-02 v1 音频与语音处理
摘要
生成模型已成功应用于图像风格迁移和域翻译。然而,在音乐音频上学习此类任务时,结果质量仍存在较大差距。此外,大多数翻译模型仅能通过依赖独立编码器或解码器以及复杂、计算密集的模型来实现一对一或一对多迁移。在本文中,我们引入调制变分自编码器(MoVE)来执行音乐音色迁移。我们将音色迁移定义为将一种乐器的部分听觉属性施加于另一种乐器。首先,我们表明可以通过用逐特征线性调制(FiLM)来调节现有的域翻译技术来实现此任务。然后,我们用最大均值差异(MMD)目标替代通常的翻译准则,从而减轻对额外对抗网络的需求。这使得训练更快且更稳定,并带来可控的潜空间编码器。通过进一步以若干不同乐器为条件,我们可以在单一变分架构内推广到多对多迁移,能够执行多域迁移。我们的模型将输入映射到三维表示,成功将音色从一种乐器翻译到另一种,并支持从一组精简的控制参数进行声音合成。我们在重建和生成任务中评估了我们的方法,同时分析了跨迁移域的听觉描述符分布。我们表明该架构支持多域迁移中的生成控制,同时保持轻量、训练快速且在小数据集上有效。
引用
@article{arxiv.1810.00222,
title = {Modulated Variational auto-Encoders for many-to-many musical timbre transfer},
author = {Adrien Bitton and Philippe Esling and Axel Chemla-Romeu-Santos},
journal= {arXiv preprint arXiv:1810.00222},
year = {2018}
}