中文

Prompt-Unseen-Emotion:基于 Prompt-LLM 上下文知识的混合情感零样本表现力语音合成

音频与语音处理 2025-06-04 v1 人工智能 声音 信号处理

摘要

现有的表现力文本转语音(TTS)系统主要对有限的离散情感类别进行建模,而人类对话远超这些预定义的情感,因此探索更多样化的情感语音生成以实现更自然的交互至关重要。为弥补这一差距,本文提出了一种新颖的提示未见情感(PUE)方法,通过情感引导的提示学习生成未见情感语音。PUE 利用 LLM-TTS 架构进行训练,以确保离散情感相关提示与情感语音之间的情感一致性,使模型能够定量捕捉每句话中不同的情感权重。在推理阶段,通过灵活调整情感比例并利用 LLM 上下文知识,可以生成混合情感语音,使模型能够量化不同的情感风格。我们提出的 PUE 成功促进了在零样本设置下对未见情感的表现力语音合成。

关键词

引用

@article{arxiv.2506.02742,
  title  = {Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions},
  author = {Xiaoxue Gao and Huayun Zhang and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2506.02742},
  year   = {2025}
}