中文

HierVST:分层自适应零样本语音风格转换

声音 2023-08-01 v1 人工智能 多媒体 音频与语音处理

摘要

尽管语音风格转换(VST)领域进展迅速,近期的零样本 VST 系统仍缺乏转换新颖说话人语音风格的能力。在本文中,我们提出 HierVST,一种分层自适应端到端零样本 VST 模型。在没有任何文本转录的情况下,我们仅利用语音数据集,通过分层变分推断和自监督表示来训练模型。此外,我们采用分层自适应生成器,依次生成音高表示和波形音频。而且,我们利用无条件生成来增强声学表示中与说话人相关的声学能力。借助分层自适应结构,模型可适应新颖语音风格并逐步转换语音。实验结果表明,我们的方法在零样本 VST 场景中优于其他 VST 模型。音频样本可在 \url{https://hiervst.github.io/} 获取。

关键词

引用

@article{arxiv.2307.16171,
  title  = {HierVST: Hierarchical Adaptive Zero-shot Voice Style Transfer},
  author = {Sang-Hoon Lee and Ha-Yeong Choi and Hyung-Seok Oh and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2307.16171},
  year   = {2023}
}

备注

INTERSPEECH 2023 (Oral)