QHARMA-GAN:基于准谐波自回归移动平均模型的神经语音合成器
音频与语音处理
2025-07-03 v1 声音
信号处理
摘要
语音合成器将语音信号编码为声学特征,并允许从这些特征重建语音信号,研究已有多年。近期,深度学习的兴起特别推动了神经语音合成器的发展,以生成高质量的语音信号。另一方面,现有的端到端神经语音合成器存在黑箱性质,这会遮蔽语音生产机制和语音的内在结构,导致无法单独建模源激励和共振特性,以及丧失灵活地以高质量合成或修改语音的能力。此外,它们的序列式波形生成通常需要复杂的网络,导致大量计算时间。本文灵感来自准谐波模型(QHM),该模型将语音表示为稀疏分量,我们将神经网络与QHM合成过程结合,提出一种新的语音合成器框架。因此,可以将语音信号编码为自回归移动平均(ARMA)函数,以建模共振特性,得到准确的准谐波振幅和相位在任意频率的估计。随后,语音可以以高质量进行 pitch 移位和时间拉伸进行任意修改,而计算时间和网络规模则大幅降低。实验表明,所提方法综合了QHM、ARMA模型和神经网络的优势,相较于其他方法在生成速度、合成质量和修改灵活性方面表现更佳。
引用
@article{arxiv.2507.01611,
title = {QHARMA-GAN: Quasi-Harmonic Neural Vocoder based on Autoregressive Moving Average Model},
author = {Shaowen Chen and Tomoki Toda},
journal= {arXiv preprint arXiv:2507.01611},
year = {2025}
}
备注
This manuscript is currently under review for publication in the IEEE Transactions on Audio, Speech, and Language Processing. This work has been submitted to the IEEE for possible publication