SAR:面向端到端语音模型的自监督抗失真表征
声音
2023-04-25 v1 音频与语音处理
摘要
在近期的文本到语音(TTS)系统中,神经声码器通常仅以声学模型预测的声学特征为条件来生成语音样本。然而,与真值相比,预测的声学特征中总是存在失真,尤其在因训练数据质量低而导致声学建模不佳的常见情况下。为克服此类局限,我们提出一种自监督学习框架,通过学习抗失真声学表征(SAR)来替代人工设计的声学特征,其做法是在自编码器预训练过程中引入失真先验。通过客观与主观评测证明,所提框架学习到的声学表征相比最常用的梅尔谱图具有抗失真性。
引用
@article{arxiv.2304.11547,
title = {SAR: Self-Supervised Anti-Distortion Representation for End-To-End Speech Model},
author = {Jianzong Wang and Xulong Zhang and Haobin Tang and Aolan Sun and Ning Cheng and Jing Xiao},
journal= {arXiv preprint arXiv:2304.11547},
year = {2023}
}
备注
Accepted by IJCNN2023. 2023 International Joint Conference on Neural Networks (IJCNN2023)