面向资源受限平台的生成式AI推理性能技术解决方案
硬件体系结构
2026-04-14 v1
摘要
生成式AI工作负载,特别是语言模型推理,正加剧内外芯片内存压力。包括视频流或图像的多模态输入以及面向问答(QA)和大文档分析的下游应用,导致上下文长度较长,需要缓存大量前导token的Key和Value状态。即便在资源受限设备(如移动设备)上进行低程度的并行推理服务,也会进一步增加内存容量压力和运行时内存管理复杂度。本文评估了两种新兴技术解决方案在容量和带宽方面的性能影响,具体包括高带宽存储(HBS)和bonded全局缓冲存储chiplet。对于大型模型(如13B参数)和长上下文,我们研究HBS的性能影响,揭示实现可接受吞吐量(尤其是交互性)所需的带宽和延迟要求。对于小型模型(如1B参数),我们评估了bonded全局缓冲存储chiplet的价值,并提出如何最佳利用它。
引用
@article{arxiv.2604.11128,
title = {Technology solutions targeting the performance of gen-AI inference in resource constrained platforms},
author = {Joyjit Kundu and Joshua Klein and Aakash Patel and Dwaipayan Biswas},
journal= {arXiv preprint arXiv:2604.11128},
year = {2026}
}