中文

基于可扩展双嵌入提取器的全 Few-shot 类增量音频分类

音频与语音处理 2024-06-13 v1 声音

摘要

在 few-shot 类增量音频分类的基座会话中,假设训练数据充足。然而,在某些实际场景中,由于某些类别的数据稀缺,收集基座会话中大量样本用于模型训练往往困难。本文探索了一种在所有会话中都只有少量训练样本的全 Few-shot 类增量音频分类新问题。此外,我们提出了一种使用可扩展双嵌入提取器的方法来解决该问题。该提议模型由嵌入提取器和可扩展分类器组成。嵌入提取器由预训练的 Audio Spectrogram Transformer (AST) 和微调后的 AST 组成。可扩展分类器由原型组成,每个原型代表一个类别。我们在三个数据集上进行实验 (LS-100、NSynth-100 和 FSC-89)。结果表明,我们的方法在平均准确率上超过了七个基线方法,且具有统计显著性。代码地址: https://github.com/YongjieSi/EDE。

关键词

引用

@article{arxiv.2406.08122,
  title  = {Fully Few-shot Class-incremental Audio Classification Using Expandable Dual-embedding Extractor},
  author = {Yongjie Si and Yanxiong Li and Jialong Li and Jiaxin Tan and Qianhua He},
  journal= {arXiv preprint arXiv:2406.08122},
  year   = {2024}
}

备注

Accepted for publication on Interspeech 2024. 5 pages, 3 figures, 5 tables