DialoSpeech:基于 LLM 与 Flow Matching 的双说话人对话生成
音频与语音处理
2025-10-28 v1 声音
摘要
近期的文本到语音 (TTS) 合成技术,特别是利用大型语言模型 (LLM) 的技术,显著提升了表达性和自然性。然而,生成人类化、交互式的对话语音仍存在挑战。当前系统受限于双轨数据稀缺,以及在多轮对话中难以实现自然性、情境连贯性和交互动态(如轮次衔接、重叠语音和说话人一致性)。为此,我们提出 DialoSpeech,一种结合大型语言模型与分块流匹配 (Chunked Flow Matching) 的双轨架构,用于生成具有表达性和人类化对话语音的合成。DialoSpeech 能够生成具有连贯说话人轮次和自然重叠的自然多轮对话,支持中文、英文及跨语言语音合成。我们引入数据处理管道以构建双轨对话数据集,促进可扩展的训练与实验验证。实验表明,我们的模型在基线模型中表现优异,为生成人类化口语化对话提供了解决方案。音频样本可在 https://tiamojames.github.io/DialoSpeech 查看。
引用
@article{arxiv.2510.08373,
title = {DialoSpeech: Dual-Speaker Dialogue Generation with LLM and Flow Matching},
author = {Hanke Xie and Dake Guo and Chengyou Wang and Yue Li and Wenjie Tian and Xinfa Zhu and Xinsheng Wang and Xiulin Li and Guanqiong Miao and Bo Liu and Lei Xie},
journal= {arXiv preprint arXiv:2510.08373},
year = {2025}
}