中文

PSLM:面向低时延语音对话系统的LLM文本与语音并行生成

计算与语言 2024-10-04 v2 人工智能 机器学习 声音 音频与语音处理

摘要

能够处理文本和语音的多模态语言模型潜力巨大,可用于语音对话系统。然而,当前模型在响应生成时延方面面临两个主要挑战:(1)生成语音响应需要先生成书面文本;(2)语音序列远长于文本序列。本研究通过扩展语言模型的输入和输出序列,支持文本和语音的并行生成,以解决上述问题。我们在语音问答任务上的实验表明,方法在保持响应内容质量的同时显著降低时延。此外,我们展示了通过在多个序列中生成语音可进一步降低时延。Demo样本可在https://rinnakk.github.io/research/publications/PSLM 查看。

关键词

引用

@article{arxiv.2406.12428,
  title  = {PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems},
  author = {Kentaro Mitsui and Koh Mitsuda and Toshiaki Wakatsuki and Yukiya Hono and Kei Sawada},
  journal= {arXiv preprint arXiv:2406.12428},
  year   = {2024}
}

备注

9 pages, 6 figures, 4 tables, accepted for Findings of EMNLP 2024. Demo samples: https://rinnakk.github.io/research/publications/PSLM