移动声源的快速算法
音频与语音处理
2025-08-19 v2 声音
摘要
现代基于神经网络的语音处理系统通常需要具备混响抗性,因此,这类系统的训练需要大量混响数据。在系统训练过程中,更倾向于使用采样静态系统来模拟动态系统,或通过实际记录的数据来补充数据。然而,这无法从根本上解决符合物理法则的运动数据仿真问题。针对语音增强模型在运动场景下训练数据不足的核心问题,本文提出了杨氏运动时空采样重建理论,以实现对运动连续时变混响的高效仿真。该理论突破了传统静态图像源法(ISM)在时变系统中的局限性。通过将移动图像源的脉冲响应分为两个部分:线性时不变调制和离散时变分数延迟,建立符合物理法则的移动声场模型。基于运动位移的带限特性,提出了分层采样策略:对低阶图像采用高采样率以保留细节,对高阶图像采用低采样率以降低计算复杂度。设计了快速合成架构,以实现实时仿真。实验表明,与开源模型相比,本文提出的理论能够更准确地恢复运动场景中的振幅和相位变化,解决了运动声源数据仿真的行业难题,为语音增强模型提供高质量的动态训练数据。
引用
@article{arxiv.2508.03065,
title = {Fast Algorithm for Moving Sound Source},
author = {Dong Yang},
journal= {arXiv preprint arXiv:2508.03065},
year = {2025}
}