中文

信息筛:端到端韵律表达性语音合成中的内容泄漏抑制

声音 2021-08-05 v1 音频与语音处理

摘要

表达性神经文本到语音(TTS)系统引入风格编码器以学习作为风格信息的潜嵌入。然而,该嵌入过程可能编码冗余的文本信息。此现象称为内容泄漏。研究者曾尝试通过添加 ASR 或其他辅助监督损失函数来解决该问题。在本研究中,我们提出一种称为“信息筛”的无监督方法,以减少韵律迁移中内容泄漏的影响。该方法的基本原理是:通过精心设计的下采样-上采样滤波器,即提取的风格嵌入按一定间隔下采样然后通过复制上采样,可迫使风格编码器关注参考语音中的风格信息而非文本信息。此外,我们在卷积层中使用实例归一化以帮助系统学习更好的潜风格空间。词错误率(WER)显著降低等客观指标证明了该模型在缓解内容泄漏方面的有效性。听感测试表明,与原始 GST-Tacotron 和 ASR 引导的 Tacotron 等基线模型相比,该模型保留了其韵律迁移能力。

关键词

引用

@article{arxiv.2108.01831,
  title  = {Information Sieve: Content Leakage Reduction in End-to-End Prosody For Expressive Speech Synthesis},
  author = {Xudong Dai and Cheng Gong and Longbiao Wang and Kaili Zhang},
  journal= {arXiv preprint arXiv:2108.01831},
  year   = {2021}
}

备注

Accepted By Interspeech 2021