中文

解锁多-LoRA 支持的基础 LLM 在边缘设备上的部署与本地加速

分布式、并行与集群计算 2026-04-27 v2 人工智能 计算与语言

摘要

在智能手机上部署大型语言模型 (LLM) 因对内存、延迟和运行时灵活性的严格限制面临重大的工程挑战。本文提出一种面向硬件的高效框架,用于在三星 Galaxy S24 和 S25 设备(配备 SM8650 和 SM8750 高通芯片)上实现 LLaMA 基于多语言基础模型的本地推理。我们的方案将特定应用的 LoRA 作为运行时输入整合到单个冻结推理图中,实现无需重新编译或额外内存开销的动态任务切换。我们进一步引入多流解码机制,在单次前向传播中并发生成风格化变体(如正式、礼貌或愉快的响应),将延迟降低最高可达 6 倍。为加速 token 生成,我们应用动态自推测解码 (DS2D),一种无需草稿模型即可预测未来 token 的树形策略,实现解码时间最高 2.3 倍的加速。结合 INT4 量化和架构级优化,我们的系统在 9 种语言和 8 项任务上实现了 4-6 倍的内存和延迟整体提升,同时保持准确性。这些结果表明在边缘设备上部署多用途 LLM 在实际可行性方面取得了突破,推动了生成式 AI 在移动平台的商业化应用。

关键词

引用

@article{arxiv.2604.18655,
  title  = {Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM},
  author = {Sravanth Kodavanti and Sowmya Vajrala and Srinivas Miriyala and Utsav Tiwari and Uttam Kumar and Utkarsh Kumar Mahawar and Achal Pratap Singh and Arya D and Narendra Mutyala and Vikram Nelvoy Rajendiran and Sharan Kumar Allur and Euntaik Lee and Dohyoung Kim and HyeonSu Lee and Gyusung Cho and JungBae Kim},
  journal= {arXiv preprint arXiv:2604.18655},
  year   = {2026}
}

备注

Accepted at ACL 2026