用于离散令牌语音生成的声学 BPE
声音
2024-01-17 v4 音频与语音处理
摘要
源自自监督学习模型的离散音频令牌已在语音生成中得到广泛使用。然而,直接利用音频令牌的当前做法因令牌序列长度而给序列建模带来挑战。此外,该方法将建立令牌间相关性的负担置于模型上,进一步使建模过程复杂化。为解决此问题,我们提出声学 BPE,其利用字节对编码对频繁音频令牌模式进行编码。声学 BPE 有效缩减序列长度,并利用了令牌序列中存在的先验形态信息,从而缓解了令牌相关性建模的挑战。通过对使用声学 BPE 训练的语音语言模型进行全面研究,我们确认了它所提供的显著优势,包括更快的推理和改进的句法捕捉能力。此外,我们提出一种新颖的重打分方法,以从富多样性 TTS 系统生成的多个候选中选出最优合成语音。实验证明重打分选择与人工偏好高度一致,这凸显了声学 BPE 在其他语音生成任务中的潜力。
引用
@article{arxiv.2310.14580,
title = {Acoustic BPE for Speech Generation with Discrete Tokens},
author = {Feiyu Shen and Yiwei Guo and Chenpeng Du and Xie Chen and Kai Yu},
journal= {arXiv preprint arXiv:2310.14580},
year = {2024}
}
备注
5 pages, 2 figures; accepted to ICASSP 2024