基于掩码音频标记建模和语义知识蒸馏的单阶段语音合成
声音
2024-09-18 v1 人工智能
音频与语音处理
信号处理
摘要
音频标记建模已成为语音合成的强大框架,两阶段方法采用语义标记仍占主导地位。本文旨在通过引入语义知识蒸馏方法,实现单阶段高质量语音生成。我们提出的模型在语音质量、语音清晰度和说话人相似性方面均优于单阶段基线。尽管两阶段系统在语音清晰度方面仍领先,但我们的模型显著缩小了差距,同时提供了可比的语音质量。这些发现展示了单阶段模型能够实现高效、高质量的语音合成,并提供了更紧凑、更简洁的架构。
引用
@article{arxiv.2409.11003,
title = {Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation},
author = {Gerard I. Gállego and Roy Fejgin and Chunghsin Yeh and Xiaoyu Liu and Gautam Bhattacharya},
journal= {arXiv preprint arXiv:2409.11003},
year = {2024}
}
备注
Demo page: see https://narsistts.github.io