中文

切片乱序核中通往内存级并行的快车道

硬件体系结构 2022-01-04 v1

摘要

利用内存级并行(MLP)对于隐藏长内存与末级缓存访问延迟至关重要。尽管乱序(OoO)核及基于它们的技术在利用 MLP 上颇为有效,但由于其复杂且高能耗的硬件,其能效低下。本工作重新审视切片乱序(sOoO)核,将其作为利用 MLP 的节能替代方案。sOoO 核通过仅相对于其余指令乱序地构建并执行生成 MLP 的指令切片来实现能效;这些切片与剩余指令各自按序执行。然而,我们观察到现有 sOoO 核因其无视依赖的按序切片执行,导致依赖切片频繁阻塞 MLP 生成,从而错失显著的 MLP 机会。为提升 MLP 生成,我们引入 Freeway,一种基于新依赖感知切片执行策略的 sOoO 核,该策略跟踪依赖切片并防止其阻塞后续独立切片与 MLP 提取。所提出的核仅带来极小面积与功耗开销,却逼近完全 OoO 核的 MLP 收益。我们的评估显示,Freeway 比最先进的 sOoO 核性能提升 12%,且处于完全 OoO 执行 MLP 极限的 7% 以内。

关键词

引用

@article{arxiv.2201.00485,
  title  = {Freeway to Memory Level Parallelism in Slice-Out-of-Order Cores},
  author = {Rakesh Kumar and Mehdi Alipour and David Black-Schaffer},
  journal= {arXiv preprint arXiv:2201.00485},
  year   = {2022}
}