面向内存受限LLM推理的部署时层级分析(MCAP)
机器学习
2026-04-27 v2
摘要
将大型语言模型部署到异构硬件时,往往受限于内存而非计算资源。我们引入MCAP(Monte Carlo Activation Profiling),一种加载时每层重要性估计器,使能在目标设备上进行动态精度和内存位置决策。MCAP产生轻量级每层信号,驱动精度调度(W4A8 vs. W4A16)和驻留层级(GPU、RAM、SSD),允许单套权重在多样化内存预算下运行。我们的系统NVE在NVIDIA T4上实现比llama-cpp Q4_0高出1.5-1.8倍的解码吞吐量,使模型能够在此前难以实现的内存区间运行,无需修改权重。
引用
@article{arxiv.2604.21026,
title = {MCAP: Deployment-Time Layer Profiling for Memory-Constrained LLM Inference},
author = {Anurita Das},
journal= {arXiv preprint arXiv:2604.21026},
year = {2026}
}
备注
Code available at https://github.com/genovationtech/nve