基于大语言模型的对话回复与语音合成联合建模探索
计算与语言
2023-09-21 v1 声音
音频与语音处理
摘要
本文探索构建一种 AI 口语对话系统的潜力,该系统能够同时“思考如何回复”和“思考如何说话”,相较于当前独立的聊天机器人与文本转语音(TTS)模块级联流水线,更贴近人类语音产生过程。我们假设拥有数十亿参数的大语言模型(LLM)具备显著的语音理解能力,并能够对对话回复与语言特征进行联合建模。我们进行了两组实验:1)韵律结构预测,这是 TTS 中典型的前端任务,用以展示 LLM 的语音理解能力;2)进一步使用统一编码格式整合对话回复与广泛的语言特征。我们的结果表明,基于 LLM 的方法是为构建统一口语对话系统的一个有前景的方向。
引用
@article{arxiv.2309.11000,
title = {Towards Joint Modeling of Dialogue Response and Speech Synthesis based on Large Language Model},
author = {Xinyu Zhou and Delong Chen and Yudong Chen},
journal= {arXiv preprint arXiv:2309.11000},
year = {2023}
}