中文

Charon:大规模 LLM 训练与推理的统一细粒度模拟器

分布式、并行与集群计算 2026-05-21 v2 人工智能 机器学习 编程语言

摘要

部署大规模 LLM 训练与推理以获得最佳性能极具挑战性,因涉及复杂的并行策略、系统优化和硬件配置。准确且快速的性能模拟对指导优化工作和系统研究至关重要,通过验证 "what-if" Hooker Figure 假设。为此,我们引入 Charon——一个统一、模块化且细粒度的 LLM 性能预测模拟器。实验表明,Charon 在不同模型和配置下均能实现高准确性,整体预测误差始终保持在 5.35% 以内,训练大规模 GPU 集群时甚至可低至 3.74%。在实际的推理部署案例中,Charon 发现一种配置可超越工程调优的基准,实现系统吞吐量提升,展示了其显著的实际价值。

关键词

引用

@article{arxiv.2605.17164,
  title  = {Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference},
  author = {Mengtian Yang and Zhekun Zhang and Mingheng Wu and Jianwen Yan and Hanshi Sun and Li-wen Chang},
  journal= {arXiv preprint arXiv:2605.17164},
  year   = {2026}
}

备注

Accepted by MLSys 2026