基于谱差分的低计算量高质量语音转换的 lifter 训练与子带建模
声音
2020-02-18 v1 音频与语音处理
摘要
本文提出基于谱差分、可直接修改波形的统计语音转换(VC)的低计算量高质量方法。采用最小相位滤波器的传统方法可实现高质量转换,但滤波计算量大。这是因为基于希尔伯特变换固定 lifter 的最小相位常导致长抽头滤波器。我们的方法之一为数据驱动的 lifter 训练方法。由于该方法在训练中考虑了滤波器截断,因而能在保持转换精度的同时缩短滤波器抽头长度。我们的另一方法为子带处理,将传统方法从窄带(16 kHz)扩展至全带(48 kHz)VC,能以更高的转换语音质量转换全带波形。实验结果表明:1)所提窄带 VC 的 lifter 训练方法可在不降低转换语音质量的前提下将抽头长度缩短至 1/16;2)所提全带 VC 的子带处理方法相较传统方法可提升转换语音质量。
引用
@article{arxiv.2002.06778,
title = {Lifter Training and Sub-band Modeling for Computationally Efficient and High-Quality Voice Conversion Using Spectral Differentials},
author = {Takaaki Saeki and Yuki Saito and Shinnosuke Takamichi and Hiroshi Saruwatari},
journal= {arXiv preprint arXiv:2002.06778},
year = {2020}
}
备注
5 pages, to appear in IEEE International Conference on Acoustics, Speech, and Signal Processing 2020 (ICASSP 2020)