GLM-4-Voice:面向智能且贴近人类的端到端 spoken chatbot
计算与语言
2024-12-04 v1 声音
音频与语音处理
摘要
我们介绍GLM-4-Voice,一款智能且贴近人类的端到端 spoken chatbot。它支持中文和英文,能够进行实时语音对话,并可根据用户指令调整语音细节,如情感、抑扬、语速和方言。GLM-4-Voice采用源自自动语音识别(ASR)模型的超低比特率(175bps)、单码book的语音tokenizer,帧率为12.5Hz,通过在编码器中引入向量量化瓶颈实现。为高效地将知识从文本模态传递到语音模态,我们使用文本到token模型从现有文本预训练语料库中合成语音-文本交替数据。我们在预训练的文本语言模型GLM-4-9B的基础上,结合非监督语音数据、交替语音-文本数据和监督语音-文本数据进行继续预训练,规模达到1 trillion tokens,在语音语言建模和spoken question answering中实现了最先进的性能。随后我们使用高质量对话式语音数据进行微调,在对话能力和语音质量方面均优于现有基线。开放模型可通过https://github.com/THUDM/GLM-4-Voice和https://huggingface.co/THUDM/glm-4-voice-9b访问。
引用
@article{arxiv.2412.02612,
title = {GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot},
author = {Aohan Zeng and Zhengxiao Du and Mingdao Liu and Kedong Wang and Shengmin Jiang and Lei Zhao and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2412.02612},
year = {2024}
}