利用基于感知声学单元所得转录文本的零资源语音合成
音频与语音处理
2020-06-09 v1 声音
摘要
零资源语音合成是构建词汇无关语音合成系统的任务,其训练数据无可用转录文本。因此,有必要将训练数据转换为可用于测试阶段合成的基本声学单元序列。本文尝试发现并建模由语音中稳态区和瞬态区组成的感知声学单元。瞬态大致对应于CV、VC单元,而稳态对应于响音和擦音。语音信号首先通过使用类短时能量轮廓将其分割为类CVC单元进行预处理。这些CVC段使用基于连通分量的图聚类技术进行聚类。聚类后的CVC段被初始化,使得起始(CV)和衰减(VC)对应瞬态,而韵部对应稳态。在此初始化之后,这些单元在连续语音中被允许重组织为HMM-GMM框架下的最终AU集合。如此获得的AU序列用于训练合成模型。所提方法的性能在Zerospeech 2019挑战赛数据库上评估。主观和客观分数表明,使用所提AU可实现质量相当好且编码比特率低的合成。
引用
@article{arxiv.2006.04372,
title = {Zero resource speech synthesis using transcripts derived from perceptual acoustic units},
author = {Karthik Pandia D S and Hema A Murthy},
journal= {arXiv preprint arXiv:2006.04372},
year = {2020}
}