用于声事件检测的频率感知卷积
声音
2024-10-30 v2 音频与语音处理
摘要
在声事件检测 (SED) 中,卷积神经网络 (CNN) 被广泛用于从频谱图中提取时频 (TF) 模式。然而,由于平移等变性,CNN 对沿频率维度移动的 TF 模式不敏感,这限制了其识别不同声事件的能力。为了解决这个问题,人们提出了一种名为频率动态卷积 (FDY) 的模型,该模型涉及将特定的卷积核应用于不同的频率分量。然而,与标准 CNN 相比,FDY 需要大量的参数和计算资源。本文提出了一种更高效的解决方案,称为频率感知卷积 (FAC)。FAC 通过将频率位置信息编码到一个向量中来引入该信息,然后将其显式添加到输入频谱图中。为了确保编码向量的幅度与输入频谱图的幅度相匹配,使用自注意力机制对编码向量进行自适应且依赖于通道的缩放。为了评估 FAC 的有效性,我们在 DCASE 2023 任务 4 的背景下进行了实验。结果表明,FAC 实现了与 FDY 相当的性能,但仅需额外 515 个参数,而 FDY 需要额外 802 万个参数。此外,消融研究证实,编码向量的自适应和通道依赖缩放对 FAC 的性能至关重要。
引用
@article{arxiv.2403.13252,
title = {Frequency-aware convolution for sound event detection},
author = {Tao Song and WenWen Zhang},
journal= {arXiv preprint arXiv:2403.13252},
year = {2024}
}