用于音乐声音建模的自编码器:线性、浅层、深层、循环与变分模型的比较
音频与语音处理
2019-05-27 v2 声音
摘要
本研究考察了利用非线性无监督降维技术将音乐数据集压缩为低维表示,并进而用于合成新声音的方法。我们系统性地比较了(浅层)自编码器(AEs)、深度自编码器(DAEs)、循环自编码器(采用长短期记忆单元——LSTM-AEs)和变分自编码器(VAEs)与主成分分析(PCA),用于将大型稠密音乐音符数据集的高分辨率短时幅度谱表示为低维向量(再转换回用于声音重合成的幅度谱)。我们的实验在公开可用的多乐器多音高数据库 NSynth 上进行。有趣的是,与近期图像处理文献相反,我们可以证明 PCA 系统性地优于浅层 AE。仅有深度与循环架构(DAEs 和 LSTM-AEs)带来了更低的重构误差。VAEs 中的优化准则为重构误差与正则化项之和,其重构精度自然低于 DAEs,但我们表明 VAEs 仍能在提供具有良好“可用性”属性的低维潜空间的同时优于 PCA。我们还给出了相应的感知音频质量客观度量(PEMO-Q 分数),其通常与重构误差良好相关。
引用
@article{arxiv.1806.04096,
title = {Autoencoders for music sound modeling: a comparison of linear, shallow, deep, recurrent and variational models},
author = {Fanny Roche and Thomas Hueber and Samuel Limier and Laurent Girin},
journal= {arXiv preprint arXiv:1806.04096},
year = {2019}
}
备注
SMC 2019