基于可控风格嵌入的任意语音 Lombard 语音合成
声音
2026-01-21 v1 计算与语言
摘要
Lombard 效应在自然交流中起着关键作用,尤其是在嘈杂环境中或面对听障听众时。我们提出了一种可控的文本到语音 (TTS) 系统,能够在训练时无需显式 Lombard 数据的情况下,为任意说话人合成 Lombard 语音。我们的方法利用从大规模、韵律多样化数据集中学习到的风格嵌入,并使用主成分分析 (PCA) 分析其与 Lombard 属性的相关性。通过偏移相关的 PCA 分量,我们操控风格嵌入并将其整合到我们的 TTS 模型中,以生成处于期望 Lombard 水平的语音。评估结果表明,我们的方法保持了自然度与说话人身份,提升了噪声下的可懂度,并提供了对韵律的细粒度控制,为任意说话人的可控 Lombard TTS 提供了稳健的解决方案。
引用
@article{arxiv.2601.12966,
title = {Lombard Speech Synthesis for Any Voice with Controllable Style Embeddings},
author = {Seymanur Akti and Alexander Waibel},
journal= {arXiv preprint arXiv:2601.12966},
year = {2026}
}