中文

MATPAC++: 增强型掩码潜在预测用于自监督音频表征学习

声音 2025-08-19 v1 人工智能

摘要

掩码潜在预测在自监督学习 (SSL) 中尤其是通用音频和音乐表征学习中已成为领先范式。尽管近期方法已显示出强性能,但输出 SSL 系统中用于解决预期任务的预测器模块的作用仍主要被忽视,尽管它对于解决实际任务至关重要。特别是,该模块应能够处理由多声源组成的音频内容所固有的歧义。本 work 提出一种新颖的增强方法:将多选学习 (MCL) 集成到显式建模预测歧义并提高表征质量中。我们建立在最近提出的 MATPAC 系统基础上,通过 MCL 改进其预测和无监督分类预期任务。我们通过线性探测多个下游任务和在 AudioSet 上微调 MATPAC++,采用统一的协议实现对 state-of-the-art SSL 方法的严格且公平的比较。结果表明,我们的提议在 AudioSet 上微调时实现了最佳性能,并在下游任务中实现整体最佳得分。此外,我们检查了通过仅在音乐数据上训练的领域专门化情况,其中我们的模型在显著提高效率的同时实现了最佳性能。

关键词

引用

@article{arxiv.2508.12709,
  title  = {MATPAC++: Enhanced Masked Latent Prediction for Self-Supervised Audio Representation Learning},
  author = {Aurian Quelennec and Pierre Chouteau and Geoffroy Peeters and Slim Essid},
  journal= {arXiv preprint arXiv:2508.12709},
  year   = {2025}
}

备注

Under review