中文

结合 CLAP 与多目标学习的掩码音频建模

声音 2024-01-30 v1 音频与语音处理

摘要

大多数现有的掩码音频建模(MAM)方法通过掩码和重建局部频谱图块来学习音频表示。然而,重建损失主要反映了重建频谱图的信号级质量,在提取高层音频语义方面仍然存在局限。在本文中,我们提出通过从对比语言-音频预训练(CLAP)表示中蒸馏跨模态知识,分别针对掩码和非掩码区域(MAM-CLAP)增强 MAM 的语义建模,并利用带有监督分类分支(SupMAM)的多目标学习策略,从而为 MAM 提供更多语义知识,使其能够有效地从标签中学习全局特征。实验表明,我们的方法显著提升了在多个下游任务上的性能。此外,通过将 MAM-CLAP 与 SupMAM 相结合,我们可以在各种音频和语音分类任务上取得新的 SOTA 结果,超越以往的自监督学习和监督预训练方法。

关键词

引用

@article{arxiv.2401.15953,
  title  = {Masked Audio Modeling with CLAP and Multi-Objective Learning},
  author = {Yifei Xin and Xiulian Peng and Yan Lu},
  journal= {arXiv preprint arXiv:2401.15953},
  year   = {2024}
}

备注

Accepted by Interspeech2023