UMDAM:面向异构 NPU-PIM 系统的统一数据布局与 DRAM 地址映射方案
分布式、并行与集群计算
2026-05-18 v2
摘要
大型语言模型(LLM)日益部署在搭载神经网络处理器(NPU)的边缘设备上,但解码阶段仍然存在显著的内存瓶颈,限制了性能。处理器内存储器(PIM)提供了可行的解决方案,但协同执行 NPU-PIM 系统面临数据布局不匹配、带宽损失和冗余存储等挑战。为此,我们提出了 UMDAM,即一种为 NPU-PIM 协同执行量身定制的统一内存亲和数据布局与 DRAM 地址映射方案。UMDAM 采用列主序、基于块的布局方式,并通过可配置的 DRAM 映射策略,确保与 NPU 计算的兼容性,同时最大化 PIM 的效率——无需额外的内存开销或带宽损失。基于 OPT 模型的综合评估表明,UMDAM 可将解码首字时间(TTFT)降低最高达 3.0 倍,将解码末字时间(TTLT)降低 2.18 倍,显著提升边缘设备上 LLM 端到端推理效率。
引用
@article{arxiv.2511.03293,
title = {UMDAM: A Unified Data Layout and DRAM Address Mapping for Heterogenous NPU-PIM},
author = {Hai Huang},
journal= {arXiv preprint arXiv:2511.03293},
year = {2026}
}
备注
arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission