Neuralink:基于神经元共激活链接的智能手机上快速 LLM 推理
机器学习
2025-10-14 v3 人工智能
操作系统
性能
摘要
大型语言模型 (LLM) 已在各个领域取得巨大成功,但在移动设备上部署它们仍然具有挑战性,因为它们需要大量的计算和内存资源。虽然已developed 轻量级 LLM 以适应移动环境,但它们 suffer from 降低的模型准确性。相比之下,稀疏性方法通过仅选择性地将相关神经元转移到 DRAM 以最小化 DRAM 用量,同时保留完整模型存储于外部存储(如闪存),但这种方法严重受限于大量 I/O 操作,尤其是在 IOPS 受限的智能手机上。本文提出了 Neuralink,一种通过优化神经元在闪存中的放置来加速智能手机上 LLM 推理的新方法。Neuralink 利用神经元共激活的概念,即频繁一起激活的神经元被链接以 facilitate 持续读取访问并优化 I/O 效率。我们的 approach 包括两个阶段:一个 offline 阶段根据共激活模式重新组织神经元放置,以及一个 online 阶段采用针对性的数据访问和缓存策略以良好地适配硬件特征。在各种智能手机和 LLM 上进行的评估表明,Neuralink 在端到端延迟方面平均实现了 的改进,优于最先进的方法。作为首个在稀疏性驱动的算法和存储级系统 co-design for LLM 推理下优化存储放置的解决方案,Neuralink 在稀疏性驱动算法与存储级系统 co-design for LLM 推理的交叉点探索了新的优化空间。
引用
@article{arxiv.2410.19274,
title = {Neuralink: Fast LLM Inference on Smartphones with Neuron Co-Activation Linking},
author = {Tuowei Wang and Ruwen Fan and Minxing Huang and Zixu Hao and Kun Li and Ting Cao and Youyou Lu and Yaoxue Zhang and Ju Ren},
journal= {arXiv preprint arXiv:2410.19274},
year = {2025}
}