基于可扩展双嵌入提取器的全 Few-shot 类增量音频分类
音频与语音处理
2024-06-13 v1 声音
摘要
在 few-shot 类增量音频分类的基座会话中,假设训练数据充足。然而,在某些实际场景中,由于某些类别的数据稀缺,收集基座会话中大量样本用于模型训练往往困难。本文探索了一种在所有会话中都只有少量训练样本的全 Few-shot 类增量音频分类新问题。此外,我们提出了一种使用可扩展双嵌入提取器的方法来解决该问题。该提议模型由嵌入提取器和可扩展分类器组成。嵌入提取器由预训练的 Audio Spectrogram Transformer (AST) 和微调后的 AST 组成。可扩展分类器由原型组成,每个原型代表一个类别。我们在三个数据集上进行实验 (LS-100、NSynth-100 和 FSC-89)。结果表明,我们的方法在平均准确率上超过了七个基线方法,且具有统计显著性。代码地址: https://github.com/YongjieSi/EDE。
引用
@article{arxiv.2406.08122,
title = {Fully Few-shot Class-incremental Audio Classification Using Expandable Dual-embedding Extractor},
author = {Yongjie Si and Yanxiong Li and Jialong Li and Jiaxin Tan and Qianhua He},
journal= {arXiv preprint arXiv:2406.08122},
year = {2024}
}
备注
Accepted for publication on Interspeech 2024. 5 pages, 3 figures, 5 tables