更多的 LLM 调用真的就够了吗?关于复合推理系统的扩展规律研究
机器学习
2024-06-06 v2 人工智能
计算与语言
系统与控制
系统与控制
摘要
近期许多语言任务的 state-of-the-art 成果都是通过执行多次 Language Model (LM) 调用并聚合其响应来实现的。然而,关于 LM 调用次数——例如询问 LM 对每个问题多次回答并取多数投票——如何影响复合系统性能的理解仍很少。本文我们着手研究复合推理系统的扩展特性。我们对 Vote 和 Filter-Vote 两种最简单的复合系统设计进行理论和实证分析,探讨 LM 调用次数如何影响其性能。我们发现,惊讶地发现,无论是在多个语言任务中,Vote 和 Filter-Vote 的性能首先会增加,然后随 LM 调用次数的增加而下降。我们的理论结果表明,这种非单调性是由于查询难度在任务中的多样性所致:更多的 LM 调用会提高对“容易”查询的性能,但降低对“困难”查询的性能,当任务包含这两类查询时,就会出现非单调行为。此洞察随后使我们能够从少量样本中计算出可实现系统性能最大值的 LM 调用次数,并为两种系统定义分析性扩展模型。实验表明,我们的扩展模型能够准确预测 Vote 和 Filter-Vote 系统的性能,从而找到最佳的 LM 调用次数。
引用
@article{arxiv.2403.02419,
title = {Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems},
author = {Lingjiao Chen and Jared Quincy Davis and Boris Hanin and Peter Bailis and Ion Stoica and Matei Zaharia and James Zou},
journal= {arXiv preprint arXiv:2403.02419},
year = {2024}
}