面向小语言模型的任务导向加速
计算与语言
2026-03-02 v1 人工智能
信息论
math.IT
摘要
小语言模型(Small Language Models, SLMs)已成为针对特定任务应用的高效大语言模型替代方案。然而,他们常在高并发、低延迟场景中使用,其中效率至关重要。我们提出了 TASC(Task-Adaptive Sequence Compression,任务适应序列压缩),一个面向 SLM 加速的框架,包含两个使用场景:在进行 SLM 微调时,我们提出 TASC-ft,通过迭代丰富高频输出 n 元组词汇表,然后对模型进行微调以利用扩展后的词汇表。随后,我们提出一种推理时间方法,称为 TASC-spec。TASC-spec 是一种轻量级、无需训练的 speculated 解码方法,从任务输出语料库构建 n 元组草稿模型,融合任务与上下文 n 元组信息。TASC-spec 在无需额外训练的情况下,绕过草稿-目标词汇对齐约束。我们在多个低输出变异生成任务上展示了两种方法的有效性。这些方法在保持任务性能的同时, consistently 改善了推理效率。
引用
@article{arxiv.2602.24174,
title = {Task-Centric Acceleration of Small-Language Models},
author = {Dor Tsur and Sharon Adar and Ran Levy},
journal= {arXiv preprint arXiv:2602.24174},
year = {2026}
}