中文

JELLY:基于 LLM 的联合情感识别与上下文推理用于对话语音合成

计算与语言 2025-01-10 v1 声音 音频与语音处理

摘要

近年来,对对话语音合成(CSS)的需求日益增长,这种技术通过考虑对话上下文来生成更自然的语音。为了解决这一问题,我们引入了 JELLY,一种新颖的 CSS 框架,该框架通过使用多个部分 LoRA 模块微调大语言模型(LLM),集成了情感识别和上下文推理,以在对话中生成合适的语音。我们提出了一种 Emotion-aware Q-former 编码器,使 LLM 能够感知语音中的情感。该编码器利用情感语音数据集进行训练,以将语音情感与文本对齐。然后使用对话语音数据对整个模型进行微调,以推断情感上下文,从而在对话中生成情感上合适的语音。我们的实验结果表明,JELLY 在情感上下文建模方面表现出色,合成的语音自然地契合对话,同时缓解了情感对话语音数据集的稀缺问题。

关键词

引用

@article{arxiv.2501.04904,
  title  = {JELLY: Joint Emotion Recognition and Context Reasoning with LLMs for Conversational Speech Synthesis},
  author = {Jun-Hyeok Cha and Seung-Bin Kim and Hyung-Seok Oh and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2501.04904},
  year   = {2025}
}

备注

Accepted by ICASSP 2025