基于三重信息瓶颈的无监督语音分解
音频与语音处理
2021-03-16 v6 机器学习
声音
摘要
语音信息可大致分解为四个成分:语言内容、音色、音高和节奏。获得这些成分的解耦表示在许多语音分析与生成应用中十分有用。近来,最先进的语音转换系统已能给出可解耦说话人相关与无关信息的语音表示。然而,这些系统只能解耦音色,而有关音高、节奏和内容的信息仍混在一起。在缺乏各成分显式标注(获取困难且昂贵)的情况下,进一步解耦其余语音成分是一个欠定问题。本文提出 SpeechSplit,通过引入三个精心设计的信息瓶颈,可盲目地将语音分解为其四个成分。SpeechSplit 是首批无需文本标签即可分别对音色、音高和节奏进行风格迁移的算法之一。我们的代码已公开于 https://github.com/auspicious3000/SpeechSplit。
引用
@article{arxiv.2004.11284,
title = {Unsupervised Speech Decomposition via Triple Information Bottleneck},
author = {Kaizhi Qian and Yang Zhang and Shiyu Chang and David Cox and Mark Hasegawa-Johnson},
journal= {arXiv preprint arXiv:2004.11284},
year = {2021}
}