中文

MobileSpeech:面向移动设备的快速高保真零样本文本转语音框架

音频与语音处理 2024-06-04 v2 声音

摘要

零样本文本转语音(TTS)因其强大的语音克隆能力而受到广泛关注,仅需几秒钟未见说话人的语音提示即可实现。然而,以往的所有工作都是为基于云的系统开发的。以自回归模型为例,尽管这些方法实现了高保真语音克隆,但在推理速度、模型大小和鲁棒性方面存在不足。因此,我们首次提出了MobileSpeech,这是一个基于移动设备的快速、轻量且鲁棒的零样本文本转语音系统。具体来说:1)利用离散编解码器,我们设计了一个名为SMD的并行语音掩码解码模块,该模块在生成过程中整合了来自语音编解码器的层次化信息以及不同编解码层之间的权重机制。此外,为了弥合文本和语音之间的差距,我们引入了一个高级概率掩码,模拟了语音生成过程中信息流从少到多的进展。2)对于说话人提示,我们从提示语音中提取细粒度的提示时长,并通过SMD中的交叉注意力将文本和提示语音结合起来。我们在不同级别的多语言数据集上展示了MobileSpeech的有效性,在生成速度和语音质量方面达到了最先进的结果。MobileSpeech在单个A100 GPU上实现了0.09的实时因子(RTF),并且我们已成功将MobileSpeech部署在移动设备上。音频样本可在\url{https://mobilespeech.github.io/}获取。

关键词

引用

@article{arxiv.2402.09378,
  title  = {MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech},
  author = {Shengpeng Ji and Ziyue Jiang and Hanting Wang and Jialong Zuo and Zhou Zhao},
  journal= {arXiv preprint arXiv:2402.09378},
  year   = {2024}
}

备注

Accepted by ACL 2024 (Main Conference)