RALL-E: 基于思维链提示的鲁棒编解码器语言建模用于文本到语音合成
音频与语音处理
2024-05-21 v3 人工智能
计算与语言
机器学习
声音
摘要
我们提出了 RALL-E,一种用于文本到语音 (TTS) 合成的鲁棒语言建模方法。尽管先前基于大型语言模型 (LLM) 的工作在零样本 TTS 上表现出令人印象深刻的性能,但由于语言模型的自回归预测风格,此类方法通常存在鲁棒性较差的问题,例如不稳定的韵律(异常的音高和节奏/时长)以及高词错率 (WER)。RALL-E 背后的核心思想是思维链 (CoT) 提示,它将任务分解为更简单的步骤以增强基于 LLM 的 TTS 的鲁棒性。为实现这一想法,RALL-E 首先预测输入文本的韵律特征(音高和时长),并将其作为中间条件以 CoT 风格预测语音 token。其次,RALL-E 利用预测的时长提示来引导 Transformer 中自注意力权重的计算,以强制模型在预测语音 token 时关注相应的音素和韵律特征。综合的客观和主观评估结果表明,与强大的基线方法 VALL-E 相比,RALL-E 将零样本 TTS 的 WER 分别从 (无重排序)和 (有重排序)显著降低至 和 。此外,我们证明 RALL-E 能够正确合成对 VALL-E 而言较困难的句子,并将错误率从 降低至 。
引用
@article{arxiv.2404.03204,
title = {RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis},
author = {Detai Xin and Xu Tan and Kai Shen and Zeqian Ju and Dongchao Yang and Yuancheng Wang and Shinnosuke Takamichi and Hiroshi Saruwatari and Shujie Liu and Jinyu Li and Sheng Zhao},
journal= {arXiv preprint arXiv:2404.03204},
year = {2024}
}