中文

思维分解: harnessing 小型语言模型与大型语言模型协同作用于高效设备内代理

计算与语言 2025-02-10 v1 人工智能

摘要

网络内容的快速扩张使得驻留设备 AI 助手对于帮助用户管理日益复杂的在线任务至关重要。大型语言模型(LLMs)中涌现的推理能力为下一代驻留设备 AI 代理提供了可行之路。然而,在资源受限的本地设备上部署完整规模的大型语言模型(LLMs)颇具挑战。本文提出了思维分解(Division-of-Thoughts, DoT),一种协作推理框架,利用驻留小型语言模型(SLMs)与云端 LLM 之间的协同效应。DoT 利用任务分解器激发语言模型内在的规划能力,将用户查询分解为更小的子任务,从而使混合语言模型能够充分发挥各自优势。此外,DoT 采用任务调度器分析子任务之间的两两依赖关系并创建依赖图,促进子任务的并行推理并识别关键步骤。为根据子任务的难度分配合适的模型,DoT 利用即插即用适配器(Plug-and-Play Adapter),这是一种附加在 SLM 上的任务头,不会改变 SLM 的参数。为提升适配器的任务分配能力,我们提出了一种依赖任务执行反馈的自强化训练方法。广泛的实验表明,我们的 DoT 在各种基准测试上显著降低了 LLM 成本,同时保持了与最佳基线方法相当的推理准确率。具体而言,DoT 将平均推理时间和 API 成本分别降低 66.12% 和 83.57%,在保持竞争推理准确率的同时实现了显著的成本效益。

关键词

引用

@article{arxiv.2502.04392,
  title  = {Division-of-Thoughts: Harnessing Hybrid Language Model Synergy for Efficient On-Device Agents},
  author = {Chenyang Shao and Xinyuan Hu and Yutang Lin and Fengli Xu},
  journal= {arXiv preprint arXiv:2502.04392},
  year   = {2025}
}