中文

CLAP:从自然语言监督中学习音频概念

声音 2022-06-13 v1 音频与语音处理

摘要

主流音频分析模型在“一个类标签对应多个录音、聚焦单一任务”的范式下训练学习。在此受限监督下学习限制了模型的灵活性,因为它们需要带标签音频进行训练且只能预测预定义类别。相反,我们提出从自然语言监督中学习音频概念。我们称我们的方法为对比语言-音频预训练(CLAP),其通过使用两个编码器及对比学习将音频和文本描述带入联合多模态空间,从而学习连接语言与音频。我们用 128k 音频-文本对训练 CLAP,并在跨 8 个领域的 16 个下游任务上评估,如声音事件分类、音乐任务和语音相关任务。尽管 CLAP 使用的配对远少于类似计算机视觉模型,它在零样本(Zero-Shot)性能上确立了 SOTA。此外,我们在监督学习设置下评估 CLAP,并在 5 个任务中达到 SOTA。因此,CLAP 的零样本能力消除了使用类标签训练的需要,在推理时实现灵活的类别预测,并泛化到多个下游任务。

关键词

引用

@article{arxiv.2206.04769,
  title  = {CLAP: Learning Audio Concepts From Natural Language Supervision},
  author = {Benjamin Elizalde and Soham Deshmukh and Mahmoud Al Ismail and Huaming Wang},
  journal= {arXiv preprint arXiv:2206.04769},
  year   = {2022}
}