让大语言模型准备好说话:一种用于语音生成的后期融合方法
计算与语言
2024-10-29 v1 人工智能
声音
音频与语音处理
摘要
大语言模型(LLMs)在各种基于文本的任务中表现出色,彻底改变了自然语言处理(NLP)。然而,将主导文本的 LLM 扩展到语音生成任务仍未被充分探索。在这项工作中,我们引入了一个由微调 Llama 模型驱动的文本到语音(TTS)系统,命名为 TTS-Llama,它实现了最先进的语音合成性能。在 TTS-Llama 的基础上,我们进一步提出了 MoLE-Llama,这是一个通过纯粹的后期融合参数高效微调(PEFT)和混合专家架构开发的文本与语音多模态 LLM。大量实证结果表明,MoLE-Llama 在纯文本问答(QA)和 TTS 任务上均具有竞争力的性能,同时缓解了任一模态中的灾难性遗忘问题。最后,我们进一步在文本输入语音输出 QA 任务中探索了 MoLE-Llama,展示了其作为具备语音生成能力的多模态对话系统的巨大潜力。
引用
@article{arxiv.2410.20336,
title = {Get Large Language Models Ready to Speak: A Late-fusion Approach for Speech Generation},
author = {Maohao Shen and Shun Zhang and Jilong Wu and Zhiping Xiu and Ehab AlBadawy and Yiting Lu and Mike Seltzer and Qing He},
journal= {arXiv preprint arXiv:2410.20336},
year = {2024}
}