面向轻量化与稳定的零样文本语音合成:自蒸馊表征解�合
声音
2025-01-16 v1 人工智能
音频与语音处理
摘要
零样文本语音合成(Zero-shot Text-To-Speech, TTS)在通过语音克隆实现个性化语音定制方面显示出巨大的潜力。然而,当前实现零样TTS的方法高度依赖大规模模型和大量训练数据,以确保在各种说话人上的满意性能和广泛性。这引发了部署成本和数据安全方面的顾虑。本文提出了一个轻量化且稳定的零样TTS系统。我们引入一种新型TTS架构,有效地从源语音和提示语音中分别建模语言内容和各种说话人属性。此外,我们提出了两个阶段的自蒸馊框架,从训练数据的角度构建平行数据对,以有效解�合语言内容和说话人。大量实验表明,我们的系统在零样TTS任务上表现出色,稳定性优异。此外,它在计算效率方面显著优越,分别在CPU和GPU上的RTF分别为0.13和0.012。
引用
@article{arxiv.2501.08566,
title = {Towards Lightweight and Stable Zero-shot TTS with Self-distilled Representation Disentanglement},
author = {Qianniu Chen and Xiaoyang Hao and Bowen Li and Yue Liu and Li Lu},
journal= {arXiv preprint arXiv:2501.08566},
year = {2025}
}
备注
5 pages,4 figures