中文

AudioMosaic:对比掩码音频表示学习

机器学习 2026-05-15 v1 人工智能 声音

摘要

音频自监督学习(SSL)旨在从大规模无标签音频数据中学习通用表示。虽然最近的进展主要由生成式重建目标驱动,但对比方法仍较少被探索,部分原因在于设计有效的音频数据增强困难且对比预训练需要大批量。我们引入了 \textbf{AudioMosaic},一种基于对比学习的音频编码器,用于通用音频理解。在预训练期间,AudioMosaic 通过对频谱图块应用结构化时频掩码来构建正样本对,这减少了内存使用并实现了高效的大批量训练。与生成式方法相比,AudioMosaic 编码器学习了更具区分性的话语级表示,在数据集、领域和声学条件之间展现出强大的可迁移性。大量实验表明,AudioMosaic 在线性探测和微调下的多个标准音频基准测试中均取得了 SOTA 性能。我们进一步表明,将预训练的 AudioMosaic 编码器集成到音频语言模型中可提高音频语言任务的性能。代码已在我们的 \href{https://github.com/HanxunH/AudioMosaic}{GitHub 仓库} 中公开。

关键词

引用

@article{arxiv.2605.14231,
  title  = {AudioMosaic: Contrastive Masked Audio Representation Learning},
  author = {Hanxun Huang and Qizhou Wang and Xingjun Ma and Cihang Xie and Christopher Leckie and Sarah Erfani},
  journal= {arXiv preprint arXiv:2605.14231},
  year   = {2026}
}

备注

ICML2026