中文

LiveSpeech: 通过音频离散码的自回归建模实现低延迟零样本文本到语音

声音 2024-06-11 v2 音频与语音处理

摘要

先前的工作通过使用生成语言模型对通过神经音频编解码器获得的音频令牌进行零样本文本到语音转换。然而,将它们适应低延迟场景仍然具有挑战性。在本文中,我们提出了LiveSpeech——一种基于完全自回归语言模型的零样本文本到语音方法,能够实现输出音频的低延迟流式传输。为了在单个解码步骤中预测多个令牌,我们提出(1)使用自适应码本损失权重,考虑每个帧中码本的贡献并关注困难实例,以及(2)分组码本并并行处理组。实验表明,我们提出的模型在内容准确性、说话人相似度、音频质量和推理速度方面取得了与最先进基线相当的结果,同时适用于低延迟流式应用。

关键词

引用

@article{arxiv.2406.02897,
  title  = {LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes},
  author = {Trung Dang and David Aponte and Dung Tran and Kazuhito Koishida},
  journal= {arXiv preprint arXiv:2406.02897},
  year   = {2024}
}