探索用于基于音频的音乐结构分析的单曲自编码方案
声音
2022-03-09 v2 机器学习
音频与语音处理
摘要
深度神经网络学习复杂数据关系与表示的能力如今已得到公认,但这通常依赖于大量训练数据。本文探索一种“曲目专用”自编码方案,其中训练一个低维自编码器来学习特定于给定歌曲的潜在/压缩表示,该表示随后可用于推断歌曲结构。此类模型不依赖于监督或标注,而后者在音乐结构分析中众所周知难以收集且常具歧义。我们报告,所提无监督自编码方案在 RWC-Pop 数据集上使用对数梅尔谱(Log Mel spectrogram)表示时,以 3 秒容差达到了有监督最优方法的性能水平。
引用
@article{arxiv.2110.14437,
title = {Exploring single-song autoencoding schemes for audio-based music structure analysis},
author = {Axel Marmoret and Jérémy E. Cohen and Frédéric Bimbot},
journal= {arXiv preprint arXiv:2110.14437},
year = {2022}
}
备注
4 pages, 4 figures, 2 tables. Rejected from ICASSP 2022, an extended version is available at arXiv:2202.04981