对比自监督学习下 transformer 的新兴音乐特性
声音
2025-07-01 v1 信息检索
机器学习
音频与语音处理
摘要
在音乐信息检索(MIR)中,对比自监督学习用于构建通用表示模型在全局任务(如自动标记)方面效果显著。然而,对于局部任务(如和弦估计),普遍认为对比式训练的通用自监督模型性能不足,需要更复杂的 SSL 方法;例如,掩码建模。我们的论文挑战了这一假设,通过揭示对比 SSL 搭配 transformer 在局部 MIR 任务中的潜能。我们考虑一种轻量级视觉 transformer,使用一维 patch 在时-频域(ViT-1D)进行训练,并通过归一化温度缩放交叉熵损失(NT-Xent)进行简单对比 SSL 训练。尽管 NT-Xent 仅作用于 class token 上,我们观察到可能由于权重共享,ViT-1D 的 sequence token 中涌现出有信息的音乐特性。在全局任务中,class 和 sequence token 的时序平均值相较于仅使用 class token 性能提升,显示出 sequence token 中有用特性。在局部任务中,sequence token 的性能意外地表现良好,尽管其并非专为该任务训练。此外,高层次音乐特征如 onset 从层级注意力图和自相似矩阵中涌现,不同层捕获不同的音乐维度。我们的论文不着重于提升性能,而是推进了 transformer 在 MIR 中音乐解释,并为对比 SSL 搭配 transformer 在序列建模中的某些被忽视的能力照亮了注意力。
关键词
引用
@article{arxiv.2506.23873,
title = {Emergent musical properties of a transformer under contrastive self-supervised learning},
author = {Yuexuan Kong and Gabriel Meseguer-Brocal and Vincent Lostanlen and Mathieu Lagrange and Romain Hennequin},
journal= {arXiv preprint arXiv:2506.23873},
year = {2025}
}
备注
Accepted at ISMIR 2025