M2D-CLAP:探索超越 CLAP 的通用音频-语言表示
音频与语音处理
2025-09-16 v2
摘要
对比式语言-音频预训练(CLAP)通过在共同特征空间中对齐音频和文本来学习音频-语言表示,已成为解决音频任务的流行方法。然而,CLAP 的音频特征缺乏通用性,而自监督学习(SSL)模型则提供在多样化音频任务中表现良好的通用特征。我们希望开发一种广泛适用的音频表示,并假设能够同时学习通用音频和 CLAP 特征的模型应能实现目标,我们称之为通用音频-语言表示。为实现该假设,我们提出了 M2D-CLAP,首次实现同时学习高效通用音频和 CLAP 特征的方法。它扩展了一个 SSL 掩码建模 duo(M2D),并整合了 CLAP,利用 LLM-based 句子嵌入。训练过程包含多个阶段。在第一个阶段,通过结合 M2D 和 CLAP 的多任务目标预训练通用音频特征,其中 CLAP 利用 LLM-based 语义嵌入将语义知识蒸馏到音频特征中。在后续阶段中,围绕所学习的音频特征,对 CLAP 特征进行预训练和细化。实验表明,M2D-CLAP 学习了高性能的通用音频特征(例如 AudioSet mAP 达49.0,在音乐任务中达到 SOTA 结果)和 CLAP 特征,从而实现了通用音频-语言表示。
引用
@article{arxiv.2503.22104,
title = {M2D-CLAP: Exploring General-purpose Audio-Language Representations Beyond CLAP},
author = {Daisuke Niizumi and Daiki Takeuchi and Masahiro Yasuda and Binh Thien Nguyen and Yasunori Ohishi and Noboru Harada},
journal= {arXiv preprint arXiv:2503.22104},
year = {2025}
}
备注
Formerly M2D2, reverted to M2D-CLAP. 15 pages, 7 figures, 13 tables. Accepted by IEEE Access