中文

LM-VC:基于语言模型的语音生成实现零样本语音转换

音频与语音处理 2023-08-22 v2 声音

摘要

基于语言模型(LM)的音频生成框架,例如 AudioLM,近期在零样本音频生成中取得了新的最先进性能。本文中,我们探索了 LM 用于零样本语音转换的可行性。一种直观的方法是遵循 AudioLM——通过 HuBERT 和 SoundStream 分别将语音分词语义令牌(semantic tokens)和声学令牌(acoustic tokens),并以目标说话人的声学令牌为条件将源语义令牌转换为目标声学令牌。然而,这种方法遇到若干问题:1)语义令牌中包含的语言内容在多层的建模过程中可能分散,而语音转换任务中冗长的语音输入使得上下文学习更加困难;2)语义令牌仍包含说话人相关信息,可能泄漏到目标语音中,降低目标说话人相似度;3)LM 采样中的生成多样性会导致推理时出现意外结果,造成不自然的发音和语音质量下降。为缓解这些问题,我们提出 LM-VC,一种两阶段语言建模方法,先生成粗粒度声学令牌以恢复源语言内容和目标说话人的音色,再重建细粒度声学细节作为转换后的语音。具体而言,为增强内容保持并促进更好的解耦,采用带掩码预测策略的掩码前缀 LM(masked prefix LM)进行粗粒度声学建模。该模型被鼓励从周围上下文恢复被掩码的内容,并基于目标说话人的话语和受损语义令牌生成目标语音。此外,为进一步减轻生成中的采样误差,引入一个采用窗口注意力(window attention)捕捉局部声学关系的外置 LM 参与粗粒度声学建模。

关键词

引用

@article{arxiv.2306.10521,
  title  = {LM-VC: Zero-shot Voice Conversion via Speech Generation based on Language Models},
  author = {Zhichao Wang and Yuanzhe Chen and Lei Xie and Qiao Tian and Yuping Wang},
  journal= {arXiv preprint arXiv:2306.10521},
  year   = {2023}
}