调优 CMS Coffea-casa 设施以应对 200 Gbps 挑战
高能物理 - 实验
2025-03-18 v1
摘要
作为 IRIS-HEP“分析大挑战”活动的一部分,Coffea-casa AF 团队执行了一项“200 Gbps 挑战”。该挑战的目标之一是提供一种设施执行设置,用于运行测试型 notebook 风格的分析,使其能够在 20 分钟内处理 200 TB 的 CMS NanoAOD 数据集。我们描述了为执行该挑战任务而在设施中部署的解决方案。该设施被配置为提供 2000+ 核心以实现快速周转和低延迟分析。为了达到最高的事件处理率,我们测试了不同的扩展后端,包括在 HTCondor 和 Kubernetes 资源上进行扩展,并使用 Dask 和 Taskvine 调度器。该配置还使我们能够在极端条件下比较两种不同的 Dask 集群管理服务:Dask labextention 和 Dask Gateway server。我们在 Kubernetes 中部署了一组带有重定向器的健壮 XCache 服务器以缓存数据集,从而最小化广域网流量。这些 XCache 服务器由部署在 Kubernetes 集群节点内的固态 NVME 驱动器提供支持。所有数据访问均使用 scitokens 进行身份验证,且对用户透明。为了确保能够精确跟踪和测量数据吞吐量,我们使用现有的 Prometheus 监控栈在 Kubernetes 网络层监控 XCache pod 的吞吐量。通过对所有 8 个 XCache pod 使用速率查询,我们能够查看每个 XCache 总吞吐量的堆叠累积图。该监控设置使我们能够确保所有节点间的数据速率均匀,同时验证我们已达到 200 Gbps 的基准。
引用
@article{arxiv.2503.12991,
title = {Tuning the CMS Coffea-casa facility for 200 Gbps Challenge},
author = {Sam Albin and Garhan Attebury and Kenneth Bloom and Brian Paul Bockelman and Benjamin Tovar Lopez and Carl Lundstedt and Oksana Shadura and John Thiltges and Derek Weitzel and Andrew Wightman},
journal= {arXiv preprint arXiv:2503.12991},
year = {2025}
}
备注
Draft submitted to EPJ journal (CHEP 2024 conference proceedings)