中文

ReCLAP:通过描述声音来提高零样本音频分类

音频与语音处理 2024-09-17 v1 计算与语言 声音

摘要

开放词汇的音频语言模型(如CLAP)为零样本音频分类(ZSAC)提供了一种通过使用自然语言提示启用可对任意类别进行分类的 promising 方法。本文提出了一种简单但有效的方法来提高ZSAC的性能。具体而言,我们从常规使用带有抽象类别标签的提示(例如“器官的声音”)转向使用描述声音在特定情境中固有特征的提示(例如“器官的深沉和共鸣的音调充满了大教堂”)。为此,我们首先提出ReCLAP,一种使用重写音频描述词训练的CLAP模型,以提高对野外声音的理解能力。这些重写的描述词使用其独特判别特征描述原始描述词中的每个声音事件。ReCLAP在多模态音频-文本检索和ZSAC方面均优于所有基线方法。接着,为改进ReCLAP的零样本音频分类,我们提出了提示增强方法。与传统使用手写模板提示的方法不同,我们为数据集中的每个唯一标签生成自定义提示。这些自定义提示首先描述该标签中的声音事件,然后在多样化的场景中使用它们。我们的方法将ReCLAP在ZSAC上的性能提高1%至18%,并通过1%至55%超过所有基线方法。

关键词

引用

@article{arxiv.2409.09213,
  title  = {ReCLAP: Improving Zero Shot Audio Classification by Describing Sounds},
  author = {Sreyan Ghosh and Sonal Kumar and Chandra Kiran Reddy Evuru and Oriol Nieto and Ramani Duraiswami and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2409.09213},
  year   = {2024}
}

备注

Code and Checkpoints: https://github.com/Sreyan88/ReCLAP