中文

表现力提示:提升零样本文本到语音中的情感强度与说话人一致性

声音 2026-04-06 v2 人工智能 计算与语言 音频与语音处理

摘要

语音合成的最新进展使得基于大型语言模型(LLM)的系统能够通过输入提示,进行内容、音色、说话人身份和情感可控的零样本生成。因此,这些模型严重依赖提示设计来引导生成过程。然而,现有的提示选择方法往往无法确保提示包含足够稳定的说话人身份线索和适当的情感强度指标,而这些对于表现力丰富的语音合成至关重要。为了应对这一挑战,我们提出了一种专为表现力丰富的语音合成设计的两阶段提示选择策略。在静态阶段(合成前),我们首先使用基于基频的韵律特征、感知音频质量以及由 LLM 评估的文本-情感一致性得分来评估候选提示。我们进一步在特定的 TTS 模型下,通过测量合成语音与提示语音之间的字符错误率、说话人相似度和情感相似度来评估这些候选提示。在动态阶段(合成期间),我们使用文本相似度模型来选择与当前输入文本最匹配的提示。实验结果表明,我们的策略能够有效选择提示,合成出兼具高情感强度表达和稳健说话人身份的语音,从而实现更具表现力且更稳定的零样本 TTS 性能。音频样本和代码可在 https://whyrrrrun.github.io/ExpPro.github.io/ 获取。

关键词

引用

@article{arxiv.2409.18512,
  title  = {Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS},
  author = {Haoyu Wang and Chunyu Qiang and Tianrui Wang and Cheng Gong and Yu Jiang and Yuheng Lu and Chen Zhang and Longbiao Wang and Jianwu Dang},
  journal= {arXiv preprint arXiv:2409.18512},
  year   = {2026}
}