PD-Swap:通过动态部分重配置实现边缘 FPGA 上端到端 LLM 推理的预填充-解码逻辑交换
硬件体系结构
2025-12-15 v1
摘要
激进量化的大语言模型(LLM),例如具有三值权重的 BitNet 风格 1.58 位 Transformer,使得在低功耗边缘 FPGA 上部署生成式 AI 成为可能。然而,随着提示词增长到数万个 token,由于二次方的预填充成本和快速增长的 KV 缓存带宽需求,边缘硬件性能随序列长度急剧下降,使得更长上下文长度的推理延迟成为一阶系统问题。最近关于 LLM 的研究揭示了预填充与解码之间根本的不对称性:预填充是计算受限的且由密集矩阵-矩阵运算主导,而解码是内存带宽受限的且由 KV 缓存流量主导。静态加速器必须为这两种情况分配资源和单一数据流,导致注意力逻辑重复、底层资源利用率不足以及严格的 LUT/URAM 限制,从而限制了模型大小和可用上下文。我们提出了一种预填充-解码分离的 LLM 加速器 PD-Swap,它使用动态部分重配置(DPR)在边缘 FPGA 上对注意力模块进行时分复用。核心的查表三值矩阵乘法和权重缓冲引擎保持静态,而注意力子系统是一个具有两种阶段专用架构的可重配置分区:计算密集型、token 并行的预填充引擎和带宽优化、以 KV 缓存为中心的解码引擎。受屋顶线启发的模型和设计空间探索联合优化了可重配置区域大小、重配置与可布线性约束下的并行度,并且重配置延迟被计算延迟所隐藏。PD-Swap 实现了高达 27 tokens/s 的解码吞吐量,比先前最先进的工作高出 1.3 倍至 2.1 倍(在更长上下文长度下增益更大),且无额外面积成本。
引用
@article{arxiv.2512.11550,
title = {PD-Swap: Prefill-Decode Logic Swapping for End-to-End LLM Inference on Edge FPGAs via Dynamic Partial Reconfiguration},
author = {Yifan Zhang and Zhiheng Chen and Ye Qiao and Sitao Huang},
journal= {arXiv preprint arXiv:2512.11550},
year = {2025}
}