VALL-T:用于鲁棒且解码可控文本到语音的解码器专用生成式转换器
音频与语音处理
2025-03-17 v5 声音
摘要
近期采用解码器专用 Transformer 架构的 TTS 模型,如 SPEAR-TTS 和 VALL-E,实现了令人印象深刻的自然度,并展示了在给定语音提示下进行零样本适应的能力。然而,此类解码器专用 TTS 模型缺乏单调对齐约束,有时会导致幻觉问题,例如发音错误、单词跳过和重复。为了解决这一局限,我们提出了 VALL-T,一种生成式转换器模型,它为输入音素序列引入了移位相对位置嵌入,在保持解码器专用 Transformer 架构的同时,明确指示了单调生成过程。因此,VALL-T 保留了基于提示的零样本适应能力,并展现出更好的抗幻觉鲁棒性,词错误率相对降低了 28.3%。
引用
@article{arxiv.2401.14321,
title = {VALL-T: Decoder-Only Generative Transducer for Robust and Decoding-Controllable Text-to-Speech},
author = {Chenpeng Du and Yiwei Guo and Hankun Wang and Yifan Yang and Zhikang Niu and Shuai Wang and Hui Zhang and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2401.14321},
year = {2025}
}
备注
Accepted to ICASSP 2025