裸金属张量虚拟化:突破ARM64边缘AI推理中的内存瓶颈
计算与语言
2026-01-08 v1 人工智能
硬件体系结构
机器学习
摘要
在边缘设备上部署大语言模型(LLM)受到“内存墙”——数据传输延迟超过算术吞吐量的瓶颈所限制。标准推理运行时通过高级抽象、动态调度和非对齐内存访问模式往往产生显著开销。本文提出一种新的“虚拟张量核心”软件架构,针对ARM64微架构(如Apple Silicon)进行优化。通过绕过标准库容器,采用直接内存映射(mmap)并实现经过优化的NEON SIMD内核,我们实现了一种“软件定义直接内存访问(DMA)”。我们提出的张量虚拟化布局(TVL)保证权重矩阵实现100%的缓存行利用率,而我们的零拷贝加载器消除了初始化延迟。在1.1亿参数模型上的实验结果表明,在M2硬件上实现稳定的60+ token/秒吞吐率。虽然专用硬件加速器(如Apple AMX)可实现更高的峰值吞吐率,但我们的架构提供了一个完全开放、可移植且确定性的参考实现,用于研究通用ARM硅片上的内存瓶颈,在不依赖不透明组件的前提下,满足200ms的人类语言学延迟阈值。
引用
@article{arxiv.2601.03324,
title = {Bare-Metal Tensor Virtualization: Overcoming the Memory Wall in Edge-AI Inference on ARM64},
author = {Bugra Kilictas and Faruk Alpay},
journal= {arXiv preprint arXiv:2601.03324},
year = {2026}
}
备注
14 pages, 2 figures. Code and data available at https://github.com/farukalpay/stories100m