中文

无需文本转写的全局节奏风格迁移

音频与语音处理 2021-06-17 v1 机器学习 声音

摘要

韵律在刻画说话人或情感风格方面起重要作用,但大多数非平行语音或情感风格迁移算法不转换任何韵律信息。韵律的两个主要成分是音高与节奏。将韵律信息(尤其是节奏成分)从语音中解耦具有挑战性,因为这涉及打破输入语音与解耦语音表征之间的同步性。因此,大多数现有韵律风格迁移算法需依赖某种形式的文本转写来识别内容信息,这将其应用限制于高资源语言。近期,SpeechSplit在无监督韵律风格迁移上取得可观进展,但无法以无监督方式提取高层全局韵律风格。本文中,我们提出AutoPST,可在不依赖任何文本转写的情况下从语音中解耦全局韵律风格。AutoPST是一种基于自编码器的韵律风格迁移框架,具有由自表达表征学习引导的彻底节奏移除模块。在不同风格迁移任务上的实验表明,AutoPST能有效转换正确反映目标域风格的韵律。

关键词

引用

@article{arxiv.2106.08519,
  title  = {Global Rhythm Style Transfer Without Text Transcriptions},
  author = {Kaizhi Qian and Yang Zhang and Shiyu Chang and Jinjun Xiong and Chuang Gan and David Cox and Mark Hasegawa-Johnson},
  journal= {arXiv preprint arXiv:2106.08519},
  year   = {2021}
}