面向语音相位预测的分阶段和先验感知神经网络模型
声音
2024-10-08 v1 人工智能
音频与语音处理
摘要
本文提出一种新型的分阶段和先验感知神经语音相位预测模型(SP-NSPP),该模型通过两个阶段的神经网络从输入�幅谱预测相位谱。在初始的先验构建阶段,我们预先预测从�幅谱得到的粗糙相位谱。随后的细化阶段则在先验相位条件下将�幅谱转化为细化后的高质量相位谱。两个阶段的网络均使用ConvNeXt v2模块作为骨干网络,并创新性地引入相位谱判别器(PSD)进行对抗训练。为进一步提高细化相位的连续性,我们还在细化阶段包含时间频率集成差分(TFID)损失。实验结果表明,与基于神经网络的无先验相位预测方法相比,所提出的SP-NSPP由于引入粗糙相位先验和多样化训练准则,实现了更高的相位预测精度。与迭代相位估计算法相比,SP-NSPP无需多轮分阶段迭代,从而实现了更高的生成效率。
引用
@article{arxiv.2410.04990,
title = {Stage-Wise and Prior-Aware Neural Speech Phase Prediction},
author = {Fei Liu and Yang Ai and Hui-Peng Du and Ye-Xin Lu and Rui-Chen Zheng and Zhen-Hua Ling},
journal= {arXiv preprint arXiv:2410.04990},
year = {2024}
}
备注
Accepted by SLT2024