SoundCount:基于二进分解神经网络的原始音频声音计数
声音
2023-12-27 v1 音频与语音处理
摘要
本文研究了一个尚未被充分探索但重要且具有挑战性的问题:在具有高度复音特性的原始音频中统计不同声音的数量。为此,我们系统地提出了一种新颖的端到端可训练神经网络(称为 DyDecNet,由二进分解前端和骨干网络组成),并根据声音的复音性量化了计数任务的难度等级。二进分解前端沿频率轴以二进方式逐步分解原始波形,以多阶段、由粗到细的方式获取时频表示。每个经父滤波器卷积的中间波形会进一步由一对子滤波器处理,这对子滤波器均匀分割父滤波器所承载的频率响应,其中高频段子滤波器编码细节,低频段子滤波器编码近似值。我们进一步引入了能量增益归一化,以归一化声音响度方差和频谱重叠,并将其应用于每个中间父波形,然后再将其输入两个子滤波器。为了更好地量化声音计数的难度等级,我们设计了三种复音感知指标:复音比、最大复音度和平均复音度。我们在多个数据集上测试了 DyDecNet 以展示其优越性,并进一步表明二进分解网络可用作解决其他声学任务的通用前端。
引用
@article{arxiv.2312.16149,
title = {SoundCount: Sound Counting from Raw Audio with Dyadic Decomposition Neural Network},
author = {Yuhang He and Zhuangzhuang Dai and Long Chen and Niki Trigoni and Andrew Markham},
journal= {arXiv preprint arXiv:2312.16149},
year = {2023}
}
备注
AAAI2024 Paper