FunCodec:一个基础、可复现且可集成的开源神经语音编解码工具包
声音
2023-10-10 v2 人工智能
音频与语音处理
摘要
本文介绍FunCodec,一个基础的神经语音编解码工具包,它是开源语音处理工具包FunASR的扩展。FunCodec为最新的神经语音编解码模型(如SoundStream与Encodec)提供可复现的训练方案与推理脚本。得益于与FunASR的统一设计,FunCodec可轻松集成到下游任务中,例如语音识别。随FunCodec一同提供了预训练模型,可用于学术或通用目的。基于该工具包,我们进一步提出频域编解码模型FreqCodec,其能以低得多的计算量与参数复杂度实现可媲美的语音质量。实验结果表明,在相同压缩比下,FunCodec相较于其他工具包与已发布模型可实现更好的重构质量。我们还展示了预训练模型适用于下游任务,包括自动语音识别与个性化文本到语音合成。该工具包公开于 https://github.com/alibaba-damo-academy/FunCodec。
引用
@article{arxiv.2309.07405,
title = {FunCodec: A Fundamental, Reproducible and Integrable Open-source Toolkit for Neural Speech Codec},
author = {Zhihao Du and Shiliang Zhang and Kai Hu and Siqi Zheng},
journal= {arXiv preprint arXiv:2309.07405},
year = {2023}
}
备注
5 pages, 3 figures, submitted to ICASSP 2024