中文

Training with Confidence: 用自动化主动检查捕捉深度学习训练中的隐式错误

机器学习 2025-06-19 v1 人工智能

摘要

深度学习模型的训练是一个复杂的过程,容易引入难以检测和诊断的隐式错误。本文提出了TRAINCHECK框架,采用主动检查方法以应对隐式训练错误。TRAINCHECK自动推断针对深度学习训练的不变量,并利用这些不变量在训练过程中主动检测隐式错误,同时提供调试支持。为评估TRAINCHECK,我们复现了20个具有多样化根源的真实隐式训练错误。TRAINCHECK在单个训练迭代中成功检测了18个错误。它还发现了6个在流行训练库中导致隐式错误的未知bug。

关键词

引用

@article{arxiv.2506.14813,
  title  = {Training with Confidence: Catching Silent Errors in Deep Learning Training with Automated Proactive Checks},
  author = {Yuxuan Jiang and Ziming Zhou and Boyu Xu and Beijie Liu and Runhui Xu and Peng Huang},
  journal= {arXiv preprint arXiv:2506.14813},
  year   = {2025}
}

备注

19 pages, to appear in 19th USENIX Symposium on Operating Systems Design and Implementation (OSDI '25)