中文

面向混合 DL 工作负载的 NoI 拓扑综合:驯服尾部延迟

硬件体系结构 2025-10-29 v1 人工智能 机器学习

摘要

异构 chiplet 系统通过解耦 CPU/GPU 和新兴技术 (HBM/DRAM) 实现规模化提升。但这种封装内解耦引入了 Network-on-Interposer (NoI) 的延迟。我们观察到,在现代大型模型推理中,参数和激活通常在 HBM/DRAM 之间来回移动,注入大量突发式流量至 interposer。这些由内存驱动的传输会膨胀尾部延迟,违反 k ARY n-cube 基线 NoI 拓扑的服务等级协议 (SLA)。为此,我们引入 InterferenceScore (IS) 以量化争用下的最坏情况减缓。随后,我们将 NoI 综合建模为多目标优化 (MOO) 问题。我们开发了 PARL (Partition-Aware Reinforcement Learner),一个平衡吞吐量、延迟和功耗的拓扑生成器。PARL 生成的拓扑在内存切口减少争用、满足 SLA 以及将最坏情况减缓降至 1.2 倍,同时保持与链路丰富网格的竞争性平均吞吐量。总体而言,这重新定义了面向异构 chiplet 加速器的 NoI 设计,引入工作负载感知的目标。

关键词

引用

@article{arxiv.2510.24113,
  title  = {Taming the Tail: NoI Topology Synthesis for Mixed DL Workloads on Chiplet-Based Accelerators},
  author = {Arnav Shukla and Harsh Sharma and Srikant Bharadwaj and Vinayak Abrol and Sujay Deb},
  journal= {arXiv preprint arXiv:2510.24113},
  year   = {2025}
}