StreamVoice:用于实时零样本语音转换的流式上下文感知语言建模
音频与语音处理
2024-07-22 v5 声音
摘要
近期语言模型(LM)的进展展示了令人印象深刻的零样本语音转换(VC)性能。然而,现有的基于 LM 的 VC 模型通常采用从源语义到声学特征的离线转换,需要完整的源语音,限制了其在实时应用中的部署。在本文中,我们介绍了 StreamVoice,一种用于零样本 VC 的新型流式基于 LM 的模型,可在给定任意说话人提示和源语音的情况下实现实时转换。具体而言,为实现流式能力,StreamVoice 采用了具有时间无关声学预测器的全因果上下文感知 LM,并在自回归的每个时间步交替处理语义和声学特征,从而消除了对完整源语音的依赖。为解决流式处理中因上下文不完整导致的潜在性能下降,我们通过两种策略增强了 LM 的上下文感知能力:1)教师引导的上下文前瞻,在训练期间使用教师模型总结当前和未来的语义上下文,以指导模型对缺失上下文的预测;2)语义掩蔽策略,利用先前受损的语义和声学输入促进声学预测,增强上下文学习能力。值得注意的是,StreamVoice 是首个无需任何未来前瞻的基于 LM 的流式零样本 VC 模型。实验表明,StreamVoice 具备流式转换能力,同时实现了与非流式 VC 系统相当的零样本性能。
引用
@article{arxiv.2401.11053,
title = {StreamVoice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot Voice Conversion},
author = {Zhichao Wang and Yuanzhe Chen and Xinsheng Wang and Lei Xie and Yuping Wang},
journal= {arXiv preprint arXiv:2401.11053},
year = {2024}
}
备注
Accepted by ACL2024 (Main)