中文

tinyCLAP:蒸馏对比语言-音频预训练模型

声音 2024-09-25 v3 计算与语言 机器学习 音频与语音处理

摘要

对比语言-音频预训练(CLAP)在音频与语音处理领域已变得至关重要。其应用范围从声音事件检测到文本到音频生成。然而,其主要局限之一在于训练过程中所需的大量数据以及推理时的整体计算复杂度。本文研究如何降低对比语言-音频预训练模型的复杂度,从而得到一种高效模型,我们称之为tinyCLAP。我们从第一性原理推导出一种单模态蒸馏损失,并探索如何通过剪枝降低共享多模态潜在空间的维数。tinyCLAP仅使用原始Microsoft CLAP参数的6%,而在其所测试的三个声音事件检测数据集上的零样本分类性能下降最小(小于5%)。

关键词

引用

@article{arxiv.2311.14517,
  title  = {tinyCLAP: Distilling Constrastive Language-Audio Pretrained Models},
  author = {Francesco Paissan and Elisabetta Farella},
  journal= {arXiv preprint arXiv:2311.14517},
  year   = {2024}
}

备注

Proceedings of Interspeech. Please use the citation available at https://www.isca-archive.org/interspeech_2024/paissan24_interspeech.html