中文

基于掩码音频标记建模和语义知识蒸馏的单阶段语音合成

声音 2024-09-18 v1 人工智能 音频与语音处理 信号处理

摘要

音频标记建模已成为语音合成的强大框架,两阶段方法采用语义标记仍占主导地位。本文旨在通过引入语义知识蒸馏方法,实现单阶段高质量语音生成。我们提出的模型在语音质量、语音清晰度和说话人相似性方面均优于单阶段基线。尽管两阶段系统在语音清晰度方面仍领先,但我们的模型显著缩小了差距,同时提供了可比的语音质量。这些发现展示了单阶段模型能够实现高效、高质量的语音合成,并提供了更紧凑、更简洁的架构。

关键词

引用

@article{arxiv.2409.11003,
  title  = {Single-stage TTS with Masked Audio Token Modeling and Semantic Knowledge Distillation},
  author = {Gerard I. Gállego and Roy Fejgin and Chunghsin Yeh and Xiaoyu Liu and Gautam Bhattacharya},
  journal= {arXiv preprint arXiv:2409.11003},
  year   = {2024}
}

备注

Demo page: see https://narsistts.github.io