用于联合声音事件检测与声学场景分类的双耳信号表示
声音
2022-09-14 v1 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
声音事件检测(SED)与声学场景分类(ASC)是两个被广泛研究的音频任务,构成了声学场景分析研究的重要部分。考虑到声音事件与声学场景之间的共享信息,联合执行这两项任务是一个复杂机器听觉系统的自然组成部分。在本文中,我们研究了若干空间音频特征在训练执行 SED 和 ASC 的联合深度神经网络(DNN)模型中的有用性。实验在两个包含双耳录音及同步声音事件与声学场景标签的不同数据集上进行,以分析分别执行与联合执行 SED 和 ASC 之间的差异。所呈现的结果表明,与使用仅基于 logmel 能量的基线方法相比,特定双耳特征(主要是带相位变换的广义互相关(GCC-phat)以及相位差的正弦与余弦)的使用使得在分离与联合任务中均获得性能更优的模型。
引用
@article{arxiv.2209.05900,
title = {Binaural Signal Representations for Joint Sound Event Detection and Acoustic Scene Classification},
author = {Daniel Aleksander Krause and Annamaria Mesaros},
journal= {arXiv preprint arXiv:2209.05900},
year = {2022}
}