基于单调对齐的 VALL-E R:稳健高效的零样文本到语音合成
计算与语言
2024-06-13 v1 声音
音频与语音处理
摘要
借助离散神经音频编解码器,大语言模型(LLM)正越来越被视为零样文本到语音(TTS)合成的有前景方法。然而,基于采样的解码策略带来惊人的生成多样性,但也带来鲁棒性问题,如拼写错误、遗漏和重复。此外,高采样率的音频还给自回归推理过程带来巨大的计算开销。为此,我们提出 VALL-E R——一个稳健高效的零样 TTS 系统,基于 VALL-E 构建。具体地,我们引入音素单调对齐策略,以强化音素与声学序列之间的联系,通过约束声学标记与其关联音素匹配,从而实现更精确的对齐。此外,我们采用编解码器合并方法,对浅层量化层中的离散代码进行下采样,从而加快解码速度,同时保持语音输出的高质量。得益于这些策略,VALL-E R 实现了对音素的可控性,并通过接近 ground truth 的 WER 表现出强大的鲁棒性。此外,它所需的自回归步骤更少,推理时间减少超过60%。本研究有望应用于包括为患有失语症者创作语音等有意义的项目。音频样本将提供于:https://aka.ms/valler。
引用
@article{arxiv.2406.07855,
title = {VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment},
author = {Bing Han and Long Zhou and Shujie Liu and Sanyuan Chen and Lingwei Meng and Yanming Qian and Yanqing Liu and Sheng Zhao and Jinyu Li and Furu Wei},
journal= {arXiv preprint arXiv:2406.07855},
year = {2024}
}
备注
15 pages, 5 figures