面向边缘LLM服务的LoRA适配器缓存与路由的在线学习——POLAR
机器学习
2026-04-21 v1 人工智能
摘要
大语言模型(LLM)的边缘部署日益依赖轻量级LoRA适配器库,但GPU/DRAM只能容纳少量驻留子集。在适配器非驻留时进行请求处理需要将其权重从存储器中分页,导致可测量的延迟。这构成了一个两时序在线控制问题:在慢时序,系统选择哪些适配器驻留在快速内存中;在快速时序,它将每个请求路由到其上下文依赖效用先验未知的适配器。两个决策紧密耦合:缓存决定探索的成本,路由器决定哪些适配器接收有信息的反馈。我们将这个联合缓存和路由问题建模为两时序情境bandit,提出POLAR(Paging and Online Learning for Adapter Routing),即分页和在线学习的适配器路由。POLAR将一个具备缓存意识的LinUCB路由器与基于epoch的缓存控制器配对。我们研究了两种变体。固定epoch版本在任意情境下提供稳健基线,具有最坏情形regret保证。epoch加倍版本POLAR+添加强制探索和改进的缓存优化,以实现的亚线性 regret,其中N为适配器数量,K为缓存大小,d为情境维度,T为时域。路由术语在对数因子范围内匹配标准情境bandit速率,表明内存层次结构不根本性地减慢路由学习。实验使用15个真实LoRA适配器用于Qwen2.5-7B,结合测量到的GPU分页延迟,显示自适应缓存控制显著优于非自适应基线,并呈现与理论一致的扩展趋势。
引用
@article{arxiv.2604.16583,
title = {POLAR: Online Learning for LoRA Adapter Caching and Routing in Edge LLM Serving},
author = {Shaoang Li and Jian Li},
journal= {arXiv preprint arXiv:2604.16583},
year = {2026}
}
备注
15pages