中文

快慢生成:大型与小型语言模型协同解码的实证研究

计算与语言 2024-10-24 v2

摘要

大型语言模型(LLMs)在 various 应用中展现出惊人的能力,但面临高推理延迟、巨大的训练成本以及产生幻觉等重大挑战。大型和小型语言模型(SLMs)之间的协同解码作为一种缓解这些问题的策略,包括拟叙解码、对比解码和仿真器或代理微调等方法。然而,这些协同方式的具体细节,特别是从统一视角进行的分析,仍然大体未被探索。灵感来自双过程认知理论,本文提出了一种统一框架,称为快慢生成(FS-GEN)。在该框架下,LLMs(有时包括 SLMs)被归类为系统2(缓慢而深思),而独立的 SLMs 则被指定为系统1(快速而直觉)。我们提供了这些协同方法的全面分析,阐明了它们的共同属性,并通过FS-GEN框架阐明了系统2与系统1之间知识能力的差异。我们的发现表明,无论采用哪种方法,少量的协同互动(在大多数情况下约小于20%)就足够。系统1和系统2之间的这种互动符合与参数比例相关的比例定律,能够实现可预测的协同。此外,我们探讨了协同最为有效的具体条件,特别是从不确定性角度出发,提供了可能指导未来优化工作的新见解。我们的研究强调,系统1与系统2之间的根本区别在于下一个标记预测的不确定性,其中由系统2的干预对于支持系统1至关重要。复现代码:https://github.com/TsinghuaC3I/FS-GEN

关键词

引用

@article{arxiv.2406.12295,
  title  = {Fast and Slow Generating: An Empirical Study on Large and Small Language Models Collaborative Decoding},
  author = {Kaiyan Zhang and Jianyu Wang and Ning Ding and Biqing Qi and Ermo Hua and Xingtai Lv and Bowen Zhou},
  journal= {arXiv preprint arXiv:2406.12295},
  year   = {2024}
}

备注

update figures and results on Pythia Series