在自监督音乐表征学习中平衡信息保留与解缠
声音
2025-08-01 v1 音频与语音处理
摘要
近期自监督学习 (SSL) 方法的进展为无需标签数据即可从音乐音频中捕获有用表征提供了多种策略。虽然一些技术专注于通过重建保持全面细节,但另一些技术则倾向于通过对比目标保留语义结构。鲜有研究在统一的 SSL 框架中考察这些范式之间的相互作用。本文我们提出一种用于解缠音乐音频表征的多视图 SSL 框架,将对比目标与重构目标相结合。该架构旨在促进信息保真度和解缠子空间中因素的结构化语义。我们在受控环境中对对比策略的设计选择进行了广泛评估。我们发现,虽然重建与对比策略都表现出一致的权衡,但当有效组合时,它们相互补充;这使得能够在不损害信息完整性的前提下实现音乐属性的解缠。
引用
@article{arxiv.2507.22995,
title = {Balancing Information Preservation and Disentanglement in Self-Supervised Music Representation Learning},
author = {Julia Wilkins and Sivan Ding and Magdalena Fuentes and Juan Pablo Bello},
journal= {arXiv preprint arXiv:2507.22995},
year = {2025}
}
备注
In proceedings of WASPAA 2025. 4 pages, 4 figures, 1 table