SPAR-K:面向口语语言模型的定期交替早退出策略
计算与语言
2026-03-11 v1 音频与语音处理
摘要
交错式口语语言模型(SLMs)交替生成文本和语音标记,但对每一步都以完整的Transformer深度解码导致计算成本高昂,尤其是由于语音序列较长。我们提出SPAR-K,一种针对加速交错式SLM推理而设计的、具备模态感知的早退出框架,以保持感知质量。SPAR-K引入语音交替深度计划:大多数语音位置在固定的中间层即可退出,而周期性的全深度“刷新”步骤可缓解因早退出导致的分布迁移。我们使用Step-Audio-2-mini和GLM-4-Voice进行框架评估,涵盖推理、事实性问答和对话任务四类数据集,评估指标包括ASR转录准确率和感知质量。实验结果表明,SPAR-K在保持问答准确率方面基本保持了问答准确率,最高准确率下降仅0.82%,同时在Step-Audio-2-mini上将平均语音解码深度降低最高11%,在GLM-4-Voice上降低5%,两种情况下MOS和WER几乎无变化且无额外计算开销。我们进一步展示了,广泛用于文本大语言模型的基于置信度的早退出策略在SLMs中次优,凸显语音标记的独特统计特性 necessitates 专门的早退出设计。
引用
@article{arxiv.2603.09215,
title = {SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models},
author = {Hsiao-Ying Huang and Cheng-Han Chiang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2603.09215},
year = {2026}
}
备注
6 pages, 1 figures, 2 tables