利用全局与局部特征学习及声音属性向量的零样本声音事件分类
声音
2023-03-21 v1 音频与语音处理
摘要
本文提出一种零样本声音事件分类(ZS-SEC)方法,用于识别训练数据中从未出现过的声音事件。在我们之前的工作中,我们提出了一种利用声音属性向量(SAVs)的 ZS-SEC 方法,其中深度神经网络模型推断描述某事件类别声音的属性信息,而非直接推断其类别标签。我们之前的方法表明其能在一定程度上分类未见事件;然而,对未见事件的准确率远不及对可见事件的准确率。本文中,我们提出一种新的 ZS-SEC 方法,可同时学习判别性全局特征与局部特征,以增强基于 SAV 的 ZS-SEC。在所提方法中,全局特征的学习用于判别训练数据中的事件类别,而谱-时局部特征的学习用于利用属性原型回归属性信息。实验结果表明,我们所提方法能提升基于 SAV 的 ZS-SEC 准确率,并能可视化谱图中与各个属性相关的区域。
引用
@article{arxiv.2303.10316,
title = {Zero-shot Sound Event Classification Using a Sound Attribute Vector with Global and Local Feature Learning},
author = {Yi-Han Lin and Xunquan Chen and Ryoichi Takashima and Tetsuya Takiguchi},
journal= {arXiv preprint arXiv:2303.10316},
year = {2023}
}
备注
Accepted by ICASSP2023