中文

PIMfused:面向CNN数据传输优化的近 banks 级DRAM-PIM with Fused-layer Dataflow

硬件体系结构 2025-11-12 v1

摘要

近 banks 级处理器内置存储(PIM)架构将处理器核心(PIMcore)集成到DRAM bank附近,以缓解芯片外存储访问的高昂成本。在加速卷积神经网络(CNN)时,PIM架构常因跨 bank(或跨 PIMcore)数据传输而受限,这些传输由强制连续CNN层之间存在跨 bank(或跨 PIMcore)依赖关系的传统分层数据流动力学所致。为此,我们提出PIMfused,这是一种硬件软件协同设计,使其能够在近 banks 级DRAM-PIM中实现 end-to-end CNN执行的 fused-layer 数据流动力学。通过采用 fused-layer 数据流动力学,PIMfused改进了数据复用,更重要的是打破了跨 bank 数据依赖关系,从而在不牺牲 bank 级别并行度的前提下优化了跨 bank 数据传输。我们使用 end-to-end ResNet18 研究了缓冲区大小和 PIMcore 并行度(1-bank vs. 4-bank)对PIMfused的影响。我们提出三个关键发现,表明在4-bank PIMcore下,PIMfused相对于GDDR6-AiM类基线在整体 PPA 方面获得提升,将内存循环次数降低至30.6%,能耗降低至83.4%,面积降低至76.5%。

关键词

引用

@article{arxiv.2511.07985,
  title  = {PIMfused: Near-Bank DRAM-PIM with Fused-layer Dataflow for CNN Data Transfer Optimization},
  author = {Simei Yang and Xinyu Shi and Lu Zhao and Yunyu Ling and Quanjun Wang and Francky Catthoor},
  journal= {arXiv preprint arXiv:2511.07985},
  year   = {2025}
}

备注

6 pages