使用变分自编码器探索调性音乐的潜在空间
声音
2023-11-08 v1 机器学习
多媒体
音频与语音处理
摘要
变分自编码器(VAEs)已被证明是生成具有认知与语义价值的潜在表示的有效模型。我们评估了在371首巴赫合唱曲这一原型调性音乐语料库上训练的VAE在多大程度上定义了代表五度圈及音乐认知中所描绘各调成分音高层级关系的潜在空间。具体而言,我们比较了不同VAE语料编码——钢琴卷帘、MIDI、ABC、Tonnetz、音高DFT和音级分布——在提供与认知距离对齐的调关系音高空间方面的潜在空间。我们使用客观指标评估这些编码的模型性能,以捕捉准确率、均方误差(MSE)、KL散度和计算成本。ABC编码在重建原始数据方面表现最佳,而音高DFT似乎从潜在空间中捕获了更多信息。此外,采用每首曲子12个大调或小调转调的客观评估,以量化1)每个调内和调间片段距离以及2)调距离到认知音高空间的对齐程度。我们的结果表明,音高DFT VAE潜在空间与认知空间对齐最佳,并提供了一个共同音空间,其中调内重叠对象为模糊簇,其施加了定义良好的结构显著性或不稳定性顺序——即调性层级。不同调的调性层级可用于在多个层级(例如音符和和弦)上度量调距离及其调内成分的关系。我们的VAE及编码框架的实现已在线公开。
引用
@article{arxiv.2311.03621,
title = {Exploring Latent Spaces of Tonal Music using Variational Autoencoders},
author = {Nádia Carvalho and Gilberto Bernardes},
journal= {arXiv preprint arXiv:2311.03621},
year = {2023}
}