中文

基于高效分层Transformer的生成式预训练语音语言模型

计算与语言 2024-11-04 v2 声音 音频与语音处理

摘要

尽管语音语言模型的最新进展取得了显著成果,但在对神经音频编解码器的长声学序列进行建模方面仍面临巨大挑战。在本文中,我们介绍了生成式预训练语音Transformer(GPST),这是一种专为高效语音语言建模而设计的分层Transformer。GPST将音频波形量化为两种不同类型的离散语音表示,并将它们集成在一个分层Transformer架构中,实现了统一的单阶段生成过程,并增强了高分辨率音频生成能力。通过以端到端无监督方式在大型语音语料库上进行训练,GPST能够生成句法一致且具有多样说话人身份的语音。给定一个简短的3秒提示,GPST可以生成自然且连贯的个性化语音,展现出上下文学习能力。此外,我们的方法可以通过结合多语言语义标记和通用声学标记,轻松扩展到跨语言语音生成。实验结果表明,GPST在词错误率、语音质量和说话人相似度方面显著优于现有的语音语言模型。代码可在https://github.com/youngsheen/GPST获取。

关键词

引用

@article{arxiv.2406.00976,
  title  = {Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer},
  author = {Yongxin Zhu and Dan Su and Liqiang He and Linli Xu and Dong Yu},
  journal= {arXiv preprint arXiv:2406.00976},
  year   = {2024}
}

备注

Accept in ACL2024-main