Llama-Mimi:探索展平化语音语言建模的极限
计算与语言
2026-03-06 v2
摘要
语音语言模型(SpeechLM)通过对语音进行分词来捕获语义与声学信息。当基于残差向量量化(RVQ)的神经音频编解码器作为音频分词器时,它们会在每个时间步产生多个离散标记,导致本质上是多层次的表征。为处理这些多层次标记,先前的工作通常采用层次化架构来捕获此类结构。相比之下,近期在自然语言处理领域的进展正逐步减少架构的归纳偏置,趋向更简单更可扩展的单 Transformer 架构。本文提出了 Llama-Mimi,将基于 Mimi 神经音频编解码器产生的多层次 RVQ 标记展平为单个序列,以 Transformer 解码器进行自回归建模。我们表明 Llama-Mimi 在大多数任务上优于基于 CSM 的层次化模型,并在声学一致性方面取得最佳性能。我们的模型、代码以及语音样本均已公开。
引用
@article{arxiv.2509.14882,
title = {Llama-Mimi: Exploring the Limits of Flattened Speech Language Modeling},
author = {Issa Sugiura and Shuhei Kurita and Yusuke Oda and Ryuichiro Higashinaka},
journal= {arXiv preprint arXiv:2509.14882},
year = {2026}
}
备注
6 pages, 1 figures