中文

基于分解线性与非线性声学-语义投影的零样本音频分类

音频与语音处理 2021-02-03 v2

摘要

本文通过音频实例与声音类之间的分解线性与非线性声学-语义投影研究音频分类中的零样本学习。音频分类中的零样本学习指旨在识别无可用训练数据、仅有语义侧信息的声音类的音频实例的分类问题。本文采用分解线性与非线性声学-语义投影来解决零样本学习。我们通过将秩分解应用于双线性模型来构建分解线性投影,并使用tanh等非线性的激活函数建模声学嵌入与语义嵌入间的非线性。与先前的双线性模型相比,实验结果表明所提投影方法能有效提升音频分类中零样本学习的分类性能。

关键词

引用

@article{arxiv.2011.12657,
  title  = {Zero-Shot Audio Classification with Factored Linear and Nonlinear Acoustic-Semantic Projections},
  author = {Huang Xie and Okko Räsänen and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2011.12657},
  year   = {2021}
}

备注

Accepted by ICASSP 2021