中文

声学 BPE 在解码器-only TTS 中的有效性研究

声音 2024-10-30 v1 人工智能 音频与语音处理

摘要

将语音离散化为 token 并通过解码器-only 模型生成,已成为文本语音合成 (TTS) 和语音语言建模 (SLM) 的热门方向。为缩短语音 token 的序列长度,声学 BPE 在 SLM 中应运而生,将自监督语义表示中的语音 token 视为字符进行进一步压缩。然而,TTS 中的收益尚未充分探讨,声学 BPE 的合适选择仍不明确。本文对 various 设置的声学 BPE 进行全面研究,以探索其在解码器-only TTS 模型中基于语义语音 token 的有效性。在 LibriTTS 上的实验验证了声学 BPE 在统一提高合成语音的可理解性和多样性方面的作用,同时在不同 BPE 设置下呈现出不同特征。因此,声学 BPE 是解码器-only TTS 的理想工具。

关键词

引用

@article{arxiv.2407.03892,
  title  = {On the Effectiveness of Acoustic BPE in Decoder-Only TTS},
  author = {Bohan Li and Feiyu Shen and Yiwei Guo and Shuai Wang and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2407.03892},
  year   = {2024}
}

备注

5 pages, 3 tables, 1 figures. accepted to Interspeech 2024