中文

基于可控风格嵌入的任意语音 Lombard 语音合成

声音 2026-01-21 v1 计算与语言

摘要

Lombard 效应在自然交流中起着关键作用,尤其是在嘈杂环境中或面对听障听众时。我们提出了一种可控的文本到语音 (TTS) 系统,能够在训练时无需显式 Lombard 数据的情况下,为任意说话人合成 Lombard 语音。我们的方法利用从大规模、韵律多样化数据集中学习到的风格嵌入,并使用主成分分析 (PCA) 分析其与 Lombard 属性的相关性。通过偏移相关的 PCA 分量,我们操控风格嵌入并将其整合到我们的 TTS 模型中,以生成处于期望 Lombard 水平的语音。评估结果表明,我们的方法保持了自然度与说话人身份,提升了噪声下的可懂度,并提供了对韵律的细粒度控制,为任意说话人的可控 Lombard TTS 提供了稳健的解决方案。

关键词

引用

@article{arxiv.2601.12966,
  title  = {Lombard Speech Synthesis for Any Voice with Controllable Style Embeddings},
  author = {Seymanur Akti and Alexander Waibel},
  journal= {arXiv preprint arXiv:2601.12966},
  year   = {2026}
}