中文

FlexInfer:通过灵活高效的卸载突破内存限制进行设备端 LLM 推理

广义相对论与量子宇宙学 2025-03-07 v1

摘要

大型语言模型 (LLM) 面临着高内存需求导致设备端推理的挑战。传统方法往往在降低内存使用方面妥协性能且缺乏适应性。我们提出了 FlexInfer,一个针对设备端推理的优化卸载框架,通过异步预取、均衡内存锁定和灵活张量保留等技术来解决这些问题。这些策略增强了内存效率,缓解了 I/O 瓶颈,确保在用户指定的资源约束下保持高性能。实验表明,FlexInfer 在有限资源下的吞吐量显著提升,比现有方法高出最高可达 12.5 倍,促进了大型模型在资源受限设备上的部署。

关键词

引用

@article{arxiv.2503.03776,
  title  = {A gap between two approaches of dimensional reduction for a six-dimensional Kaluza-Klein theory},
  author = {Tuan Q. Do and W. F. Kao},
  journal= {arXiv preprint arXiv:2503.03776},
  year   = {2025}
}

备注

16 pages. Accepted for publication in The European Physical Journal Plus (EPJ Plus). Comments are welcome