WaveTrainerFit:带可训练先验和固定点迭代的神经声码器,用于从 SSL 特征生成高质量语音
音频与语音处理
2026-02-06 v1 声音
摘要
我们提出 WaveTrainerFit,一种从数据驱动特征(如 SSL 特征)生成高质量波形的神经声码器。WaveTrainerFit 基于 WaveFit 声码器构建,后者集成了扩散模型和生成对抗网络。此外,本文提出的关键改进包括:1. 通过引入可训练先验,推理过程从接近目标语音的噪声开始,而非高斯噪声。2. 通过对可训练先验施加约束实现参考感知增益调整,以匹配语音能量。这些改进有助于减少从数据驱动特征进行波形建模的复杂度,使能够以更少的推理步骤生成高质量波形。通过实验,我们展示 WaveTrainerFit 能够从数据驱动特征生成高度自然的波形,改善说话人相似度,同时所需迭代次数少于 WaveFit。此外,我们展示所提出方法对于 SSL 特征提取的深度具有稳健性。代码和预训练模型可在 https://github.com/line/WaveTrainerFit 获取。
引用
@article{arxiv.2602.05443,
title = {Wave-Trainer-Fit: Neural Vocoder with Trainable Prior and Fixed-Point Iteration towards High-Quality Speech Generation from SSL features},
author = {Hien Ohnaka and Yuma Shirahata and Masaya Kawamura},
journal= {arXiv preprint arXiv:2602.05443},
year = {2026}
}
备注
Accepted by IEEE ICASSP 2026. 5 pages, 3 figures, and 2 tables