基于谱时域感受野的听觉神经响应启发式声事件检测
音频与语音处理
2023-06-21 v1
摘要
声事件检测(SED)是通过人类听觉系统聆听并理解听觉场景以实现自动化功能的任务之一。因此,我们受到启发,希望使 SED 像人类听觉系统那样识别声事件。谱时域感受野(STRF)是一种描述耳朵感知声音与听觉皮层中转换的神经响应之间关系的方法,与声音识别密切相关。在这项工作中,我们利用 STRF 作为 SED 模型第一卷积层的卷积核,从输入声音中提取神经响应,使 SED 模型类似于人类听觉系统。此外,我们构建了一个名为双分支 STRFNet(TB-STRFNet)的双分支 SED 模型,由 STRF 分支和基线分支组成。STRF 分支从听觉神经响应中提取声事件信息,而基线分支则像传统 SED 模型那样直接从 mel 频谱图中提取声事件信息。在阈值无关的宏 F1 分数方面,TB-STRFNet 超过 DCASE 基线 4.3\%,在 DCASE Challenge 2023 Task 4b 中获得第 4 名。我们通过应用频率动态卷积(FDYConv)进一步改进了 TB-STRFNet,该方法同样利用了声学领域的领域知识。结果表明,在两个分支上均应用 FDYConv 的双分支模型在同一指标上超过 DCASE 基线 6.2\%。
引用
@article{arxiv.2306.11427,
title = {Auditory Neural Response Inspired Sound Event Detection Based on Spectro-temporal Receptive Field},
author = {Deokki Min and Hyeonuk Nam and Yong-Hwa Park},
journal= {arXiv preprint arXiv:2306.11427},
year = {2023}
}
备注
Submitted to DCASE 2023 Workshop