LongCat-Audio-Codec:面向语音大语言模型的音频标记器与解标记器解决方案
音频与语音处理
2025-10-20 v1 声音
摘要
本文提出 LongCat-Audio-Codec,一种为工业级 end-to-end 语音大语言模型设计的音频标记器与解标记器解决方案。通过采用解耦模型架构和多阶段训练策略,LongCat-Audio-Codec 在语义建模、灵活声学特征提取和低延迟流式合成方面表现出色。其以 16.67 Hz 的超低帧率对语音进行编码,最小比特率为 0.43 kbps,最大比特率为 0.87 kbps。评估结果表明,LongCat-Audio-Codec 能够实现卓越的语音可理解性,并能在低比特率下合成高质量语音,从而有效平衡编码效率与解码质量。推理代码和模型 checkpoints 已在 https://github.com/meituan-longcat/LongCat-Audio-Codec 提供。
引用
@article{arxiv.2510.15227,
title = {LongCat-Audio-Codec: An Audio Tokenizer and Detokenizer Solution Designed for Speech Large Language Models},
author = {Xiaohan Zhao and Hongyu Xiang and Shengze Ye and Song Li and Zhengkun Tian and Guanyu Chen and Ke Ding and Guanglu Wan},
journal= {arXiv preprint arXiv:2510.15227},
year = {2025}
}