面向自然对话的副语言学感知语音增强大语言模型
计算与语言
2024-12-02 v3 声音
音频与语音处理
摘要
近期研究在扩展大语言模型(LLM)直接理解和合成语音的能力方面取得了令人鼓舞的成果。然而,基于LLM的语音对话建模策略仍不明确,有待进一步探索。本文介绍了一个广泛的语音-文本LLM框架——统一口语对话模型(USDM),旨在生成连贯的口语响应,并带有与给定输入语音相关的自然韵律特征,而无需依赖显式的自动语音识别(ASR)或文本转语音(TTS)系统。我们验证了在主要包含语义信息的语音标记中融入韵律,并以此为基础构建了韵律注入的语音-文本模型。此外,我们提出了一种通用的语音-文本预训练方案,以增强跨模态语义的捕获。为了构建USDM,我们使用多步口语对话模板对语音-文本模型进行微调,该模板激发了底层LLM的推理链能力。在DailyTalk数据集上的自动和人工评估表明,我们的方法能够有效生成听起来自然的语音响应,超越了先前的方法和级联基线。我们的代码和检查点可在https://github.com/naver-ai/usdm获取。
引用
@article{arxiv.2402.05706,
title = {Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation},
author = {Heeseung Kim and Soonshin Seo and Kyeongseok Jeong and Ohsung Kwon and Soyoon Kim and Jungwhan Kim and Jaehong Lee and Eunwoo Song and Myungwoo Oh and Jung-Woo Ha and Sungroh Yoon and Kang Min Yoo},
journal= {arXiv preprint arXiv:2402.05706},
year = {2024}
}
备注
NeurIPS 2024, Project Page: https://unifiedsdm.github.io/