基于平行幅度谱和相位谱估计的神经语音分离
声音
2025-09-18 v1
摘要
本文提出了一种新型神经语音分离模型APSS,其采用平行的幅度谱和相位谱估计。与大多数现有语音分离方法不同,APSS通过显式估计相位谱来实现更完整和准确的分离。具体而言,APSS首先从混合语音信号中提取幅度谱和相位谱。随后,这些提取的幅度谱和相位谱通过特征融合器融合为联合表示,再由带有时频Transformer的深度处理器进一步处理,以捕获时序和频谱依赖性。最后,利用平行的幅度和相位分离器,APSS从 resulting features 中分别估计每个说话者的谱,并通过逆短时傅里叶变换(iSTFT)重构分离后的语音信号。实验结果表明,APSS优于时域分离方法和基于隐式相位估计的时间频率方法。此外,APSS在多个数据集上实现了稳定且具竞争力的结果,突显了其强大的泛化能力和实际应用前景。
引用
@article{arxiv.2509.13825,
title = {Neural Speech Separation with Parallel Amplitude and Phase Spectrum Estimation},
author = {Fei Liu and Yang Ai and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2509.13825},
year = {2025}
}
备注
Accepted by APSIPA2025