面向实时区域导向声源分离的推理自适应神经驾驶
音频与语音处理
2024-10-23 v1
摘要
我们提出了一种 novel Neural Steering 技术,能够在推理阶段而无需重新训练深度神经网络(DNN)的情况下自适应地调整空间感知多麦克风声源分离算法的目标区域。为实现此目标,我们首先训练一个 DNN,旨在保留目标区域内的语音(由角度范围定义),同时抑制来自其他方向的声源。随后,对麦克风信号施加相位移,允许我们在推理时将目标区域的中心轻松地移动,而无需额外的计算复杂度。进一步的实验表明,我们提出的方法在各种声学场景中表现良好,包括目标区域内外的多个说话者以及额外的噪声。更准确地说,我们的方法在 DNSMOS 和 SI-SDR 指标上与为明确的驾驶目标区域训练的 DNN 性能相当。
引用
@article{arxiv.2408.12982,
title = {Inference-Adaptive Neural Steering for Real-Time Area-Based Sound Source Separation},
author = {Martin Strauss and Wolfgang Mack and María Luis Valero and Okan Köpüklü},
journal= {arXiv preprint arXiv:2408.12982},
year = {2024}
}
备注
This work has been submitted to the IEEE for possible publication