低比特率高质量基于 RVQGAN 的离散语音标记器
音频与语音处理
2024-10-14 v1
摘要
离散音频编解码器(或音频标记器)最近因大语言模型(LLMs)能够学习其压缩声学表示而重新受到关注。各种公开可用的可训练离散标记器最近在音频标记方面展示了令人印象深刻的结果,然而它们大多需要较高的标记率才能获得高质量的重建。本研究考虑多种录音条件和质量水平,对开源通用音频 RVQGAN 模型进行微调。 resulting 的宽带(24kHz)语音专用模型实现了近乎可与 PCM(脉冲编码调制)相当的语音重建,速率为 150-300 个标记/秒(1500-3000 bps)。评估使用涵盖不同录音条件的综合英文语音数据,包括录音棚设置。语音样本已公开提供于 http://ibm.biz/IS24SpeechRVQ。该模型已在 https://huggingface.co/ibm/DAC.speech.v1.0 正式发布。
引用
@article{arxiv.2410.08325,
title = {Low Bitrate High-Quality RVQGAN-based Discrete Speech Tokenizer},
author = {Slava Shechtman and Avihu Dekel},
journal= {arXiv preprint arXiv:2410.08325},
year = {2024}
}
备注
You can download the model from https://huggingface.co/ibm/DAC.speech.v1.0