中文

解锁基于提示的文本到语音模型中细粒度且词内说话风格控制能力

计算与语言 2026-05-28 v1 人工智能

摘要

虽然基于提示的文本到语音(TTS)模型实现了自然语言驱动的说话风格控制,但往往只能提供有限的细粒度控制,并在整个句子中应用单一的全局风格。这限制了需要在句子之间和时间内持续风格属性插值,以及在单个句子内部实现风格转换的实际应用场景。本文提出了实现上述两种能力的新技术。对于词间风格插值,我们在嵌入空间中计算对比式风格提示之间的方向向量,并进行简单插值,从而实现风格特征之间的平滑过渡。对于词内风格转换,我们首先识别到自回归 TTS 解码器对早期 token 存在强烈注意力偏向,导致初始音频实现主导后续生成。为缓解此效应,我们引入 KV-cache 交换和滑动窗口注意力掩码。实验表明,我们提出的词间插值在性别转换中实现 99-100% 成功率,最高可达 36 Hz 的音高变化,最高可达 1.6 音节/秒 的速度变化。我们的词内转换保持说话者相似度为 0.81-0.91,并实现感知平滑度评分 3.48-4.48。

关键词

引用

@article{arxiv.2605.27376,
  title  = {Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models},
  author = {Jaehoon Kang and Yejin Lee and Yoonji Park and Kyuhong Shim},
  journal= {arXiv preprint arXiv:2605.27376},
  year   = {2026}
}