基于深度学习的开放集声学场景分类
音频与语音处理
2020-08-18 v1 机器学习
声音
摘要
本工作中,我们比较了三种选定技术在开放集声学场景分类(ASC)中的性能。我们测试了深度网络分类器 softmax 输出的阈值化方法,这是当前 ASC 中最流行的技术。进一步我们将结果与源自计算机视觉领域的 Openmax 分类器进行比较。作为第三个模型,我们使用了自适应类条件自编码器(Adapted C2AE),其是我们对另一种称为 C2AE 的计算机视觉相关技术的变体。Adapted C2AE 包含了给定实验中更公平的比较并简化了原始推理过程,使其在真实场景应用中更具适用性。我们还分析了两种训练场景:无未知类额外知识,以及可获得未知类有限子集示例的另一场景。我们发现基于 C2AE 的方法优于阈值化与 Openmax,在 Detection and Classification of Acoustic Scenes and Events Challenge 2019 Task 1C 所用数据上取得了 的接收者操作特征曲线下面积(AUROC)与 的开放集准确率。
引用
@article{arxiv.2008.07247,
title = {Deep Learning Based Open Set Acoustic Scene Classification},
author = {Zuzanna Kwiatkowska and Beniamin Kalinowski and Michał Kośmider and Krzysztof Rykaczewski},
journal= {arXiv preprint arXiv:2008.07247},
year = {2020}
}
备注
This paper was submitted to conference INTERSPEECH 2020