CPU上的低延迟实时语音转换
声音
2023-11-03 v1 机器学习
音频与语音处理
摘要
我们将先前音频处理与生成神经网络的架构适配于实时任意到单语音转换任务。我们所得的模型LLVC(低延迟低资源语音转换,Low-latency Low-resource Voice Conversion)在16kHz比特率下具有低于20ms的延迟,并在消费级CPU上以近乎2.8倍于实时的速度运行。LLVC同时使用生成对抗架构和知识蒸馏以达到此性能。据我们所知,LLVC在所有开源语音转换模型中实现了最低的资源占用以及最低的延迟。我们在https://github.com/KoeAI/LLVC提供了开源样本、代码和预训练模型权重。
引用
@article{arxiv.2311.00873,
title = {Low-latency Real-time Voice Conversion on CPU},
author = {Konstantine Sadov and Matthew Hutter and Asara Near},
journal= {arXiv preprint arXiv:2311.00873},
year = {2023}
}
备注
8 pages, 2 figures