中文

IS${}^3$:使用深度滤波的声学场景中通用脉冲-平稳声分离

音频与语音处理 2025-09-15 v2 人工智能 声音 信号处理

摘要

我们关注能够对声学场景中的平稳背景和孤立声事件进行差异化处理的音频系统,无论是对各部分应用特定处理方法,还是仅关注其中一个而忽略另一个。此类系统在现实场景中具有广泛应用,包括鲁棒的自适应音频渲染系统(例如 EQ 或压缩)、语音混音中的爆破音衰减、噪声抑制或消除、鲁棒的声事件分类乃至生物声学。为此,我们提出了 IS3{}^3,一种用于脉冲-平稳声分离的神经网络,它使用深度滤波方法将脉冲声事件从平稳背景中分离出来,可作为上述任务的预处理阶段。为确保最佳训练效果,我们提出了一种复杂的数据生成流水线,为该任务筛选并调整现有数据集。我们证明,基于相对轻量级的神经网络架构并用精心设计且多样化的数据训练的学习方法,在此前未被解决的这一任务中取得了成功,在客观分离指标上优于从音乐信号处理研究改编的谐波-打击声分离掩蔽方法以及小波滤波。

关键词

引用

@article{arxiv.2509.02622,
  title  = {IS${}^3$ : Generic Impulsive--Stationary Sound Separation in Acoustic Scenes using Deep Filtering},
  author = {Clémentine Berger and Paraskevas Stamatiadis and Roland Badeau and Slim Essid},
  journal= {arXiv preprint arXiv:2509.02622},
  year   = {2025}
}