从学习的F0码本表示中改进VQ-VAE语音波形重建的韵律
音频与语音处理
2020-05-19 v1 声音
摘要
向量量化变分自编码器(VQ-VAE)是一种强大的表示学习框架,可以在无监督的情况下从语音信号中发现离散的特征组。迄今为止,VQ-VAE架构此前仅对单个类型的语音特征进行建模,例如仅音素或仅F0。本文介绍了VQ-VAE的一个重要扩展,用于同时学习与传统音素特征相关的F0超音段信息。所提出的框架使用两个编码器,使得F0轨迹和语音波形都作为系统输入,从而学习到两个独立的码本。我们使用WaveRNN声码器作为VQ-VAE的解码器组件。我们的说话人无关VQ-VAE使用来自多说话人日语语音数据库的的原始语音波形进行训练。实验结果表明,所提出的扩展减少了所有未见测试说话人重构语音的F0失真,并在听测中获得了显著更高的偏好分数。我们还使用单说话人普通话语音进行了实验,以展示我们的架构在另一种高度依赖F0的语言中的优势。
引用
@article{arxiv.2005.07884,
title = {Improved Prosody from Learned F0 Codebook Representations for VQ-VAE Speech Waveform Reconstruction},
author = {Yi Zhao and Haoyu Li and Cheng-I Lai and Jennifer Williams and Erica Cooper and Junichi Yamagishi},
journal= {arXiv preprint arXiv:2005.07884},
year = {2020}
}
备注
Submitted to Interspeech 2020