基于动态扩展分类器与自注意力修正原型的少样本类增量音频分类
音频与语音处理
2023-06-01 v1
摘要
现有大多数音频分类方法假设待分类音频类的词表是固定的。当 novel(未见)音频类出现时,音频分类系统需要用所有音频类的丰富标注样本重新训练,以识别 base(初始)和 novel 音频类。如果 novel 音频类持续出现,现有音频分类方法将效率低下甚至不可行。本文提出一种少样本类增量音频分类方法,能够持续识别 novel 音频类而不遗忘旧类。我们的方法框架主要由两部分组成:嵌入提取器和分类器,二者构建解耦。嵌入提取器是基于 ResNet 的网络主干,仅使用 base 音频类样本通过训练策略构建后冻结。而由原型组成的分类器在增量会话中通过原型适配网络借助 novel 音频类的少量样本进行扩展。标注支持样本和未标注查询样本用于训练原型适配网络并更新分类器,因为它们对音频分类具有信息价值。分别从 NSynth、FSD-MIX-CLIP 和 LibriSpeech 语料中选取样本构建了 NSynth-100、FSC-89 和 LS-100 三个音频数据集。结果表明,我们的方法在平均准确率和性能下降率上超过基线方法,并且在计算复杂度和内存需求上与基线方法相比具有竞争力。我们的方法代码见 https://github.com/vinceasvp/FCAC。
引用
@article{arxiv.2305.19539,
title = {Few-shot Class-incremental Audio Classification Using Dynamically Expanded Classifier with Self-attention Modified Prototypes},
author = {Yanxiong Li and Wenchang Cao and Wei Xie and Jialong Li and Emmanouil Benetos},
journal= {arXiv preprint arXiv:2305.19539},
year = {2023}
}
备注
13 pages, 8 figures, 12 tables. Accepted for publication in IEEE TMM