NanoCodec:面向高质量超快速语音 LLM 推理
音频与语音处理
2025-08-11 v1 计算与语言
声音
摘要
大型语言模型(LLM)通过利用音频编解码器将音频离散化为标记,显著推动了音频处理领域的发展,使语言建模技术得以应用于语音数据。然而,现有音频编解码器往往 operates at 高帧率,导致训练和推理速度慢,尤其是针对自回归模型。为此,越来越多的人关注低帧率音频编解码器,这类编解码器减少了生成一秒音频所需的自回归步骤。在本文中,我们进行消融研究,检验帧率、比特率和因果性对编解码器重建质量的影响。基于我们的发现,我们引入NanoCodec,一种在每秒仅12.5帧(FPS)即可实现高质量压缩的先进音频编解码器。NanoCodec 在各种比特率范围内均超越相关工作,为低延迟和高效 Speech LLM 训练和推理树立了新基准。
引用
@article{arxiv.2508.05835,
title = {NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference},
author = {Edresson Casanova and Paarth Neekhara and Ryan Langman and Shehzeen Hussain and Subhankar Ghosh and Xuesong Yang and Ante Jukić and Jason Li and Boris Ginsburg},
journal= {arXiv preprint arXiv:2508.05835},
year = {2025}
}
备注
Accepted to Interspeech 2025