快速思维链:并行解码对未来的一瞥带来更迅捷的答案
计算与语言
2024-06-05 v2
摘要
本工作中,我们提出FastCoT,一种基于并行解码且与模型无关的框架,无需对辅助模型进行进一步训练或修改LLM本身。FastCoT使用大小随位置变化的大小可变上下文窗口,同时执行并行解码与自回归解码,从而充分利用GPU计算资源。在FastCoT中,并行解码部分向LLM提供由近似 token 组成的对未来的一瞥,与因果 transformer 使用的常规自回归解码相比,可带来更迅捷的答案。我们还提供了LLM内并行解码的实现,支持KV-cache生成与批处理。通过大量实验,我们证明FastCoT相比常规方法以可忽略的性能下降节省近20%推理时间。此外,我们展示了上下文窗口大小对不同任务具有相当的鲁棒性。
引用
@article{arxiv.2311.08263,
title = {Fast Chain-of-Thought: A Glance of Future from Parallel Decoding Leads to Answers Faster},
author = {Hongxuan Zhang and Zhining Liu and Yao Zhao and Jiaqi Zheng and Chenyi Zhuang and Jinjie Gu and Guihai Chen},
journal= {arXiv preprint arXiv:2311.08263},
year = {2024}
}