将语音语言模型与LLM集成用于自发 spoken 对话生成
音频与语音处理
2025-01-03 v1 计算与语言
声音
摘要
近期基于语音单元的``无文本''语音语言模型(SLM)在生成自然语音(包括非语义 vocalization)方面取得了显著进展。然而,生成的语音样本常缺乏语义连贯性。本文提出将SLM与LLM集成用于自发 spoken 对话生成(SLIDE)。具体而言,首先利用LLM生成 spoken 对话的文本内容。随后,将文本对话转换为音素序列,并使用基于两个塔的Transformer结构的时长预测器预测每个音素的时长。最后,使用以 spoken 音素序列为条件的SLM对文本对话进行 vocalization。Fisher数据集上的实验结果表明,系统能够在保持高语义连贯性的同时生成自然的 spoken 对话。
引用
@article{arxiv.2501.00805,
title = {SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation},
author = {Haitian Lu and Gaofeng Cheng and Liuping Luo and Leying Zhang and Yanmin Qian and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2501.00805},
year = {2025}
}
备注
Accepted by ICASSP 2025