用于音频场景分类的深度特征嵌入与层次分类
音频与语音处理
2020-02-13 v1 声音
摘要
在本工作中,我们提出一种以三元组损失函数实现深度特征嵌入学习与层次分类的声学场景分类(ASC)方法。一方面,首先训练一个深度卷积神经网络从场景音频信号中学习特征嵌入。通过训练好的卷积神经网络,所学嵌入将输入嵌入到嵌入特征空间中并转换为用于表征的高层特征向量。另一方面,为利用场景类别的结构,将原始场景分类问题构建为一个层次结构,其中相似类别被归为元类别。然后,使用与三元组损失函数相关联的深度神经网络分类器完成层次分类。我们的实验表明,所提系统在 DCASE 2018 Task 1A 和 1B 数据集上均取得良好性能,相较于 DCASE 2018 基线在 Task 1A 和 1B 上分别获得 15.6% 和 16.6% 的绝对准确率提升。
引用
@article{arxiv.2002.04857,
title = {Deep Feature Embedding and Hierarchical Classification for Audio Scene Classification},
author = {Lam Pham and Ian McLoughlin and Huy Phan and Ramaswamy Palaniappan and Alfred Mertins},
journal= {arXiv preprint arXiv:2002.04857},
year = {2020}
}