基于语义嵌入的零样本音频分类
音频与语音处理
2021-02-12 v2
摘要
本文研究音频分类中通过从声音类的文本标签与句子描述提取的语义嵌入实现的零样本学习。我们的目标是获得一个能够识别无可用训练样本、仅有语义侧信息的声音类音频实例的分类器。我们采用双线性兼容框架来学习音频实例与声音类中间层表示(即声学嵌入与语义嵌入)之间的声学-语义投影。我们使用 VGGish 从音频片段提取深度声学嵌入,并使用预训练语言模型(Word2Vec、GloVe、BERT)从声音类的文本标签生成标签嵌入,或从其句子描述生成句子嵌入。音频分类由一个线性兼容函数执行,该函数度量声学嵌入与语义嵌入之间的兼容程度。我们在小型平衡数据集 ESC-50 与大规模非平衡音频子集 AudioSet 上评估所提方法。实验结果表明,在训练中加入与测试类语义相近的声音类可显著提升分类性能。同时,我们证明标签嵌入与句子嵌入均有助于零样本学习。通过拼接不同语言模型生成的标签/句子嵌入,分类性能得以提高;而采用其混合拼接,结果进一步提升。
引用
@article{arxiv.2011.12133,
title = {Zero-Shot Audio Classification via Semantic Embeddings},
author = {Huang Xie and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2011.12133},
year = {2021}
}
备注
Submitted to Transactions on Audio, Speech and Language Processing