中文

将语音语言模型与LLM集成用于自发 spoken 对话生成

音频与语音处理 2025-01-03 v1 计算与语言 声音

摘要

近期基于语音单元的``无文本''语音语言模型(SLM)在生成自然语音(包括非语义 vocalization)方面取得了显著进展。然而,生成的语音样本常缺乏语义连贯性。本文提出将SLM与LLM集成用于自发 spoken 对话生成(SLIDE)。具体而言,首先利用LLM生成 spoken 对话的文本内容。随后,将文本对话转换为音素序列,并使用基于两个塔的Transformer结构的时长预测器预测每个音素的时长。最后,使用以 spoken 音素序列为条件的SLM对文本对话进行 vocalization。Fisher数据集上的实验结果表明,系统能够在保持高语义连贯性的同时生成自然的 spoken 对话。

关键词

引用

@article{arxiv.2501.00805,
  title  = {SLIDE: Integrating Speech Language Model with LLM for Spontaneous Spoken Dialogue Generation},
  author = {Haitian Lu and Gaofeng Cheng and Liuping Luo and Leying Zhang and Yanmin Qian and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2501.00805},
  year   = {2025}
}

备注

Accepted by ICASSP 2025