中文

用于文本到语音合成的自回归扩散变换器

音频与语音处理 2024-06-11 v1 人工智能 计算与语言 机器学习 声音

摘要

音频语言模型最近作为各种音频生成任务的有前景的方法,依赖音频标记化器将波形编码为离散符号序列。音频标记化通常在代码比特率与重构精度之间做出必要的权衡。当处理低比特率音频代码时,语言模型受限于仅处理音频中嵌入的子集信息,从而限制了其生成能力。为克服这些问题,我们提出将音频编码为连续空间 Rd\mathbb R^d 中的向量序列,并使用仅解码器的扩散变换器 (ARDiT) 自回归生成这些序列。我们的发现表明,ARDiT 在零样本文本到语音方面表现出色,性能甚至优于最先进的模型。高比特率的连续语音表示几乎可以实现完美重构,使我们的模型能够实现近乎完美的语音编辑。我们的实验表明,在每个自回归步骤上采用积分克拉布尔-库尔比 (IKL) 发散进行蒸馏可显著提升样本的感知质量。同时,将扩散模型的迭代采样过程浓缩为单一步骤。此外,ARDiT 可以训练在一步内预测多个连续向量,显著减少采样时的延迟。令人印象深刻的是,我们的一个模型可以在每次评估步骤中生成约 170 毫秒的 24 kHz 语音,同时在性能上几乎没有退化。音频样本可在 http://ardit-tts.github.io/ 查看。

关键词

引用

@article{arxiv.2406.05551,
  title  = {Autoregressive Diffusion Transformer for Text-to-Speech Synthesis},
  author = {Zhijun Liu and Shuai Wang and Sho Inoue and Qibing Bai and Haizhou Li},
  journal= {arXiv preprint arXiv:2406.05551},
  year   = {2024}
}