基于类别标签嵌入的零样本音频分类
机器学习
2019-08-08 v2 声音
音频与语音处理
机器学习
摘要
本文提出一种基于类别标签文本信息且无需目标类别任何音频样本的零样本学习音频分类方法。我们提出了一种构建于双线性模型上的音频分类系统,该系统以音频特征嵌入和语义类别标签嵌入为输入,并度量音频特征嵌入与类别标签嵌入之间的兼容性。我们使用VGGish从音频记录中提取音频特征嵌入。我们将文本标签视为音频类别的语义边信息,并使用Word2Vec生成类别标签嵌入。在ESC-50数据集上的结果表明,所提系统可使用小训练集进行零样本音频分类。其在每个音频类别上能达到(平均26%)优于随机猜测(10%)的准确率。特别地,在自然音频类别上可达到39.7%。
引用
@article{arxiv.1905.01926,
title = {Zero-Shot Audio Classification Based on Class Label Embeddings},
author = {Huang Xie and Tuomas Virtanen},
journal= {arXiv preprint arXiv:1905.01926},
year = {2019}
}
备注
2019 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)