多模态、多任务、多对话场景下 LLM 的本地-云推理卸载
机器学习
2026-01-01 v4 分布式、并行与集群计算
摘要
与传统机器学习模型不同,近期的大型语言模型 (LLM) 能够通过多轮对话和多模态数据源展现出多任务解决能力。这些 LLM 的独特特征以及大型模型规模,使得其部署更具挑战性。具体而言,(i) 在本地设备上部署 LLM 面临计算、内存和能源资源问题,而 (ii) 在云端部署则无法保证实时服务且产生通信/使用成本。本文设计了 TMO,即一种具有 Three-M Offloading 的本地-云 LLM 推理系统:Multi-modal、Multi-task 和 Multi-dialogue。TMO 集成了 (i) 能够在高速处理简单任务的轻量级本地 LLM,和 (ii) 能够处理多模态数据源的大规模云端 LLM。我们开发了资源受限强化学习 (RCRL) 策略用于 TMO,优化每个任务/对话的推理位置(即本地或云端)和要使用的多模态数据源,以在资源约束条件下最大化长期奖励(响应质量、延迟和使用成本)。我们还贡献了 M4A1 数据集,包含跨多种模态、任务、对话和 LLM 配置的奖励和成本指标,支持对卸载决策的评估。我们展示了 TMO 在多个探索-决策和 LLM-作为-代理基准中有效性,显著改善了延迟、成本和响应质量。
引用
@article{arxiv.2502.11007,
title = {Local-Cloud Inference Offloading for LLMs in Multi-Modal, Multi-Task, Multi-Dialogue Settings},
author = {Liangqi Yuan and Dong-Jun Han and Shiqiang Wang and Christopher G. Brinton},
journal= {arXiv preprint arXiv:2502.11007},
year = {2026}
}