所有大大小小的语言模型
机器学习
2024-06-06 v2 人工智能
计算与语言
摘要
许多领先的语言模型(LM)在训练和执行期间都使用高强度的计算资源。这给降低部署资源成本以及加快执行决策任务等带来了挑战。我们引入了一种新颖的即插即用 LM 框架,命名为语言优化网络分布(LONDI)框架。LONDI 学习仅在需要复杂决策和推理的地方选择性地使用大型 LM,而在其他所有地方使用低资源 LM(即 GPU 使用率较低,但可能无法单独解决问题的 LM)。LONDI 由一个包含两个(离)策略网络的系统、一个 LM、一个大型语言模型(LLM)以及一个强化学习模块组成,该模块使用切换控制来快速学习在哪些系统状态下调用 LLM。随后,我们引入了 LONDI 的一个变体,该变体维持对 LLM 调用的预算约束,从而限制其资源使用。在理论上,我们证明了 LONDI 能够学习到需要激活 LLM 以解决任务的系统状态子集。接着我们证明,LONDI 几乎必然收敛于最优解,同时保持对 LLM 调用的预算约束,使其能够在显著降低计算成本的同时解决各种任务。我们在 ScienceWorld 和 BabyAI-Text 的一系列任务中测试了 LONDI 的性能,并证明 LONDI 能够解决原本只能由资源密集型 LLM 解决的任务,同时将 GPU 使用量降低多达 30%。
引用
@article{arxiv.2402.12061,
title = {All Language Models Large and Small},
author = {Zhixun Chen and Yali Du and David Mguni},
journal= {arXiv preprint arXiv:2402.12061},
year = {2024}
}