中文

GPUAlert:用于诊断GPU训练任务故障的零插桩进程边界监视器

软件工程 2026-07-01 v1 人工智能 机器学习

摘要

GPU训练任务经常失败,在大型生产集群上大约五分之二的任务会失败,然而操作员通常只能在数小时后重新连接时才得知故障。实验跟踪器需要编辑训练脚本并维持云连接;调度器的邮件钩子只发送一行状态信息,没有原因和日志。GPUAlert是一个命令行包装器,它在进程边界监视任何训练命令,无需修改该命令,即可在完成时发送包含分类故障原因、持久日志和输出工件的结构化通知电子邮件。该工具围绕三个可靠性原语组织:启动前日志保证,在子进程可能崩溃之前建立持久目标;通知器隔离,使包装器的退出代码成为子进程状态的纯函数,无论电子邮件是否发送成功;以及非静默工件预算,限制附件大小而不会静默丢弃输出。我们发布了一个包含15种故障类别的474个GPU训练日志的标记语料库和一个可复现的评估框架。在十二个硬件复现的类别上,有序规则分类器达到0.997的宏F1分数,而无序关键词匹配为0.830,退出代码检查为0.133。包装器开销恒定约为每个任务3毫秒;启动前保证保留了shell重定向无法产生任何内容的日志;并且在所有15种故障模式下,即使SMTP中继不可达,包装器也原样返回子进程的退出代码。

关键词

引用

@article{arxiv.2607.01409,
  title  = {GPUAlert: A Zero-Instrumentation Process-Boundary Monitor for Diagnosing GPU Training-Job Failures},
  author = {Parv Agarwal and Asif Ekbal},
  journal= {arXiv preprint arXiv:2607.01409},
  year   = {2026}
}

备注

8 pages, 3 figures, 4 tables,3 Listings. Submitted as an arXiv preprint. Source, corpus and evaluation harness available at https://github.com/Parv-01/gpualert and https://github.com/Parv-01/gpualert-eval