用于解耦音乐音频表示的自监督多视角学习
声音
2024-11-06 v1 音频与语音处理
摘要
自监督学习(SSL)提供了一种无需标注数据即可学习鲁棒、可泛化表示的强大方法。在音乐领域,标注数据稀缺,现有SSL方法通常使用生成式监督和多视角冗余来创建代理任务。然而,这些方法往往产生耦合表示并丢失视角特定信息。我们提出了一种新颖的自监督多视角音频学习框架,旨在激励私有表示空间和共享表示空间之间的分离。在受控设置下的音频解耦案例研究证明了本方法的有效性。
引用
@article{arxiv.2411.02711,
title = {Self-Supervised Multi-View Learning for Disentangled Music Audio Representations},
author = {Julia Wilkins and Sivan Ding and Magdalena Fuentes and Juan Pablo Bello},
journal= {arXiv preprint arXiv:2411.02711},
year = {2024}
}
备注
Late Breaking Demo at ISMIR 2024. https://juliawilkins.github.io/marlbymarl/