Nix-TTS:基于模块级蒸馏的轻量级端到端语音合成
声音
2022-11-08 v2 计算与语言
机器学习
神经与进化计算
音频与语音处理
摘要
若干轻量级 TTS 方案已展现出有前景的结果。但它们要么依赖手工设计而达到非最优规模,要么使用神经架构搜索却常受训练成本之苦。我们提出 Nix-TTS,一种通过知识蒸馏至一个高质量但规模大、非自回归且端到端(无声码器)的 TTS 教师模型而实现的轻量级 TTS。具体而言,我们提供模块级蒸馏,实现对编码器与解码器模块的灵活且独立的蒸馏。所得 Nix-TTS 从教师模型继承了非自回归与端到端的优势特性,但规模显著更小,仅含 5.23M 参数,或至多减少教师模型的 89.34%;其在 Intel-i7 CPU 与 Raspberry Pi 3B 上分别实现超过 3.04 倍与 8.36 倍的推理加速,且相较教师模型仍保持尚可的语音自然度与可懂度。我们提供 Nix-TTS 的预训练模型与音频样本。
引用
@article{arxiv.2203.15643,
title = {Nix-TTS: Lightweight and End-to-End Text-to-Speech via Module-wise Distillation},
author = {Rendi Chevi and Radityo Eko Prasojo and Alham Fikri Aji and Andros Tjandra and Sakriani Sakti},
journal= {arXiv preprint arXiv:2203.15643},
year = {2022}
}
备注
Accepted at SLT 2022 (https://slt2022.org/). Associated materials can be seen in https://github.com/rendchevi/nix-tts