Minions:面向云端与设备端语言模型协作的低成本方案
机器学习
2025-02-27 v1 人工智能
计算与语言
分布式、并行与集群计算
摘要
我们研究了一种新兴的设置,即小型本地数据访问的本地语言模型(LM)与 frontier 云端托管 LM 协作,以解决涉及对长文档进行金融、医疗和科学推理的实际任务。本地远程协作能否在保持质量的同时降低云端推理成本?首先,我们考虑一种简单的协作协议,即本地模型和远程模型来回交谈。由于只有本地模型读取完整上下文,该协议可实现远程成本降低30.4倍,但仅恢复 frontier 模型性能的87%。我们识别了该协议的两个关键局限性:本地模型(1)难以遵循远程模型的多步骤指令,(2)在长上下文上进行推理。针对上述观察,我们研究了该协议的一种扩展,称为MinionS,在该协议中,远程模型将任务分解为对文档较短块的更易执行子任务,这些子任务在本地并行执行。MinionS平均降低成本5.7倍,同时恢复远程模型alone的97.9%性能。我们的分析揭示了影响本地远程系统中成本与性能权衡的若干关键设计选择。
引用
@article{arxiv.2502.15964,
title = {Minions: Cost-efficient Collaboration Between On-device and Cloud Language Models},
author = {Avanika Narayan and Dan Biderman and Sabri Eyuboglu and Avner May and Scott Linderman and James Zou and Christopher Re},
journal= {arXiv preprint arXiv:2502.15964},
year = {2025}
}