中文

ACALSim:面向高性能系统设计空间探索的可扩展并行仿真框架

计算与语言 2026-05-25 v1

摘要

架构仿真已成为高性能计算系统设计空间探索的关键瓶颈。现代 GPU 和 AI 加速器——具有数百至数千个紧密耦合组件——迫切需要提供高效并行和可扩展单节点执行的仿真框架。现有框架不足:SST 侧重于多节点 MPI 可扩展性,但在节点内扩展方面受限;GPGPU-Sim 基本保持单线程。关键的是,没有任何框架暴露用户优化特定工作负载线程的机制。我们引入 ACALSim,一个可扩展并行仿真框架,为构建高性能仿真器提供基础设施和 API——timing-model 准确性仍由仿真器开发者负责。其关键创新是可插拔线程管理架构,使开发者能够为特定仿真模式实现自定义调度策略,现有框架中不存在。配套措施包括 (1) 事件驱动执行通过 fast-forward 消除空闲周期开销,(2) 共享内存数据模型实现零拷贝通信,以及 (3) 两个阶段的并行执行模型实现确定性线程扩展。我们通过针对 A100 级架构的 GPU 仿真器 HPCSim 展示 ACALSim。相对于使用相同共享 timing 核心的 SST 实现(以隔离框架开销),ACALSim 在 41% 更低的内存占用下实现了 14 倍以上的加速;硬件验证确认其 cycle-count 与 A100 测量值之间的 0.72--1.22 倍相关性。尽管 SST 在 256+ 线程块工作负载下无法在实际时间限制内完成,但 ACALSim 能够在 LLaMA-7B 用时 17.7 分钟、LLaMA-13B 用时 30.4 分钟模拟完整的 LLaMA transformer 层——实现 SST 无法实现的设计空间探索。

关键词

引用

@article{arxiv.2605.22937,
  title  = {RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation},
  author = {Minseok Jung and Abhas Ricky and Muhammad Rameez Chatni},
  journal= {arXiv preprint arXiv:2605.22937},
  year   = {2026}
}