用于一次性音乐风格迁移的自监督 VQ-VAE
声音
2021-06-11 v2 机器学习
音频与语音处理
机器学习
摘要
神经风格迁移能够将一幅图像的艺术风格应用于另一幅图像,在提出后不久便成为展示最广泛的计算机视觉应用之一。相比之下,音乐音频领域中的相关任务直到最近仍基本未被解决。虽然已提出几种针对音乐信号的风格转换方法,但大多数缺乏经典图像风格迁移算法的“一次性”能力。另一方面,现有一次性音频风格迁移方法在音乐输入上的结果并不尽如人意。本工作中,我们特别关注一次性音色迁移问题。我们提出了一种基于向量量化变分自编码器(VQ-VAE)扩展的新方法,以及一种旨在获得音色与音高解耦表示的简单自监督学习策略。我们使用一组客观指标评估该方法,并表明其能够超越所选基线。
引用
@article{arxiv.2102.05749,
title = {Self-Supervised VQ-VAE for One-Shot Music Style Transfer},
author = {Ondřej Cífka and Alexey Ozerov and Umut Şimşekli and Gaël Richard},
journal= {arXiv preprint arXiv:2102.05749},
year = {2021}
}
备注
ICASSP 2021. Website: https://adasp.telecom-paris.fr/s/ss-vq-vae