中文

VALL-T:用于鲁棒且解码可控文本到语音的解码器专用生成式转换器

音频与语音处理 2025-03-17 v5 声音

摘要

近期采用解码器专用 Transformer 架构的 TTS 模型,如 SPEAR-TTS 和 VALL-E,实现了令人印象深刻的自然度,并展示了在给定语音提示下进行零样本适应的能力。然而,此类解码器专用 TTS 模型缺乏单调对齐约束,有时会导致幻觉问题,例如发音错误、单词跳过和重复。为了解决这一局限,我们提出了 VALL-T,一种生成式转换器模型,它为输入音素序列引入了移位相对位置嵌入,在保持解码器专用 Transformer 架构的同时,明确指示了单调生成过程。因此,VALL-T 保留了基于提示的零样本适应能力,并展现出更好的抗幻觉鲁棒性,词错误率相对降低了 28.3%。

关键词

引用

@article{arxiv.2401.14321,
  title  = {VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech},
  author = {Chenpeng Du and Yiwei Guo and Hankun Wang and Yifan Yang and Zhikang Niu and Shuai Wang and Hui Zhang and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2401.14321},
  year   = {2025}
}

备注

Accepted to ICASSP 2025