中文

分类任务的多模型式投机解码适应

计算与语言 2025-03-25 v1

摘要

本研究提出了一种将投机解码(speculative decoding)从生成任务重新定位到分类任务的新型方法。我们提出了一种多模型框架,最多使用三个轻量级worker模型和单个更稳健的judge模型,类似于投机解码中的草稿模型和目标模型。worker模型负责处理大部分计算,独立预测给定输入的离散类别标签。当多个worker模型对标签达成一致时,即接受该标签作为最终结果,以避免调用计算密集型的judge模型,从而优化效率。在 disagreement(分歧)情况下,judge模型介入以解决标签问题。该方法最小化了冗余计算,利用多个worker模型的冗余性提高置信度,并将judge模型的角色限制在具有挑战性的案例中,从而在效率和准确性之间提供了实用的平衡。我们的分析表明,参数规模为30亿(以下简称3B)的较小无需额外微调的指令/聊天微调worker模型在准确度上与70亿(以下简称7B)的较大微调worker模型相当,这适用于简单任务和高阶推理任务。最佳组合的3B worker模型在情感分析任务中达到约80-83%的一致性,在类似ticket任务中达到约50-80%的一致性。此外,3B worker模型相对于judge模型实现了2.8倍至9倍的加速,而7B worker模型组合实现了1.28倍至0.28倍的加速。

关键词

引用

@article{arxiv.2503.18076,
  title  = {A Multi-Model Adaptation of Speculative Decoding for Classification},
  author = {Somnath Roy and Padharthi Sreekar and Srivatsa Narasimha and Anubhav Anand},
  journal= {arXiv preprint arXiv:2503.18076},
  year   = {2025}
}