M2D-CLAP:掩码建模对偶结合CLAP学习通用音频-语言表征
音频与语音处理
2024-06-05 v1 多媒体
声音
摘要
对比语言-音频预训练(CLAP)实现了音频的零样本(ZS)推理,并在若干分类任务中展现出有前景的性能。然而,对于许多不适用零样本的任务(例如回归问题),传统的音频表征仍然至关重要。在此,我们探索一种新的表征——通用音频-语言表征,它在零样本学习和迁移学习中均表现良好。为此,我们提出了一种新方法M2D-CLAP,它结合了自监督学习的掩码建模对偶(M2D)和CLAP。M2D学习一种有效的表征来对音频信号进行建模,而CLAP则将表征与文本嵌入对齐。因此,M2D-CLAP学习到一种通用的表征,既支持零样本学习也支持迁移学习。实验表明,M2D-CLAP在线性评估、微调和零样本分类中均表现良好,在GTZAN数据集上达到了75.17%的最新水平,从而实现了通用音频-语言表征。
引用
@article{arxiv.2406.02032,
title = {M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation},
author = {Daisuke Niizumi and Daiki Takeuchi and Yasunori Ohishi and Noboru Harada and Masahiro Yasuda and Shunsuke Tsubaki and Keisuke Imoto},
journal= {arXiv preprint arXiv:2406.02032},
year = {2024}
}
备注
5 pages, 1 figure, 5 tables. Accepted by Interspeech 2024