Bunched LPCNet2:覆盖从云端到边缘设备的高效神经声码器
音频与语音处理
2022-07-01 v2 机器学习
声音
摘要
在边缘设备上运行的文本到语音(TTS)服务相比云端 TTS 具有诸多优势,例如延迟与隐私问题。然而,低复杂度且模型占用小的神经声码器不可避免地会产生恼人的声音。本研究提出 Bunched LPCNet2,一种改进的 LPCNet 架构,在云端服务器上以高质量提供高效性能,在低资源边缘设备上以低复杂度运行。单逻辑分布实现了计算效率,且富有洞见的技巧在保持语音质量的同时减小了模型占用。还提出了一种 DualRate 架构,从韵律模型生成较低采样率,以降低维护成本。实验表明,Bunched LPCNet2 在 RPi 3B 上以快于实时的速度运行,同时以 1.1MB 的模型占用生成令人满意的语音质量。我们的音频样本可在 https://srtts.github.io/bunchedLPCNet2 获取。
引用
@article{arxiv.2203.14416,
title = {Bunched LPCNet2: Efficient Neural Vocoders Covering Devices from Cloud to Edge},
author = {Sangjun Park and Kihyun Choo and Joohyung Lee and Anton V. Porov and Konstantin Osipov and June Sig Sung},
journal= {arXiv preprint arXiv:2203.14416},
year = {2022}
}
备注
Interspeech 2022