中文

用于说话人镜像分离的神经前向滤波

音频与语音处理 2025-10-08 v1

摘要

我们研究混响条件下单声道多说话人镜像分离问题,旨在分离混合说话人同时保留各说话人的混响效果。一种直接的方法是训练端到端深度神经网络系统,根据输入混合信号预测各说话人的混响语音。虽然有效,但该方法未显式利用混响语音可由直达路径信号与线性滤波器卷积得到的物理约束。为解决此问题,我们提出 CxNet,即一种包含神经前向滤波模块的双 DNN 系统。第一个 DNN 被训练用于联合预测直达路径信号和混响语音。基于直达路径估计,神经前向滤波模块估计线性滤波器,并将估计的滤波器与直达路径估计进行卷积以获得混响语音的另一个估计,该估计被用作判别性特征以帮助第二个 DNN 更好地估计混响语音。通过显式建模线性滤波器,CxNet 能够利用直达路径信号与混响语音之间的物理约束来捕获关于混响尾部的关键信息。在 SMS-WSJ 数据集上的评估结果验证了所提算法的有效性。

关键词

引用

@article{arxiv.2510.05757,
  title  = {Neural Forward Filtering for Speaker-Image Separation},
  author = {Jingqi Sun and Shulin He and Ruizhe Pang and Zhong-Qiu Wang},
  journal= {arXiv preprint arXiv:2510.05757},
  year   = {2025}
}

备注

in submission