中文

自导向深度非线性空间选择性滤波器:在弱引导下高效提取移动说话人

音频与语音处理 2025-07-08 v2 机器学习 声音

摘要

近期关于深度非线性空间选择性滤波器的工作表明,对于已知方向的静态说话人,这些滤波器在计算轻量级架构上表现出卓越的增强性能。然而,为了在动态场景中保持这种性能,需要资源密集型的数据驱动跟踪算法,以提供基于目标说话人初始方向的精确空间引导。由于这种额外的计算开销阻碍了在资源受限场景(如实时语音增强)中的应用,我们提出了一种新策略,即使用低复杂度的跟踪算法,具体形式为粒子滤波器。假设采用因果的、顺序的处理方式,我们引入时间反馈,以利用空间选择性滤波器的增强语音信号来补偿粒子滤波器有限建模能力。在合成数据集上的评估表明,两种算法之间的自回归交互作用极大地提高了跟踪精度,并带来了强大的增强性能。对真实世界录音的听测实验补充了这些发现,表明我们提出的自导向流水线是优于可比方法的首选方案。

关键词

引用

@article{arxiv.2507.02791,
  title  = {Self-Steering Deep Non-Linear Spatially Selective Filters for Efficient Extraction of Moving Speakers under Weak Guidance},
  author = {Jakob Kienegger and Alina Mannanova and Huajian Fang and Timo Gerkmann},
  journal= {arXiv preprint arXiv:2507.02791},
  year   = {2025}
}

备注

Accepted at IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA) 2025. Video demonstration: https://youtu.be/aSKOSh5JZ3o