ELLA-V:基于对齐引导序列重排序的稳定神经编解码语言模型
计算与语言
2024-01-17 v1 人工智能
声音
音频与语音处理
摘要
基于声学和语言提示的语言模型(LM)方法,如VALL-E,在零样本音频生成领域取得了显著进展。然而,现有方法仍存在一些局限性:1)由于音频和音素标记之间的对齐约束有限,输出合成语音中存在重复、换位和遗漏;2)使用自回归(AR)语言模型对合成语音进行细粒度控制具有挑战性;3)由于AR解码的特性,特别是在贪婪策略下,会产生无限静音生成。为了缓解这些问题,我们提出了ELLA-V,一个简单但高效的基于LM的零样本文本转语音(TTS)框架,它能够在音素级别对合成音频进行细粒度控制。ELLA-V的关键是交错排列声学标记和音素标记的序列,其中音素标记出现在相应的声学标记之前。实验结果表明,我们的模型在准确性上优于VALL-E,并且在使用贪婪和基于采样的解码策略时都能产生更稳定的结果。ELLA-V的代码将在清理后开源。音频样本可在https://ereboas.github.io/ELLAV/获取。
引用
@article{arxiv.2401.07333,
title = {ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering},
author = {Yakun Song and Zhuo Chen and Xiaofei Wang and Ziyang Ma and Xie Chen},
journal= {arXiv preprint arXiv:2401.07333},
year = {2024}
}
备注
Working in progress