中文

用于持续训练的多版本后见日志

软件工程 2024-10-24 v4 数据库

摘要

生产型机器学习涉及持续训练:随时间托管模型的多个版本,通常许多模型版本同时运行。当模型性能未达预期时,机器学习工程师(MLE)通过探索和分析大量先前的代码与训练数据版本来识别根本原因并缓解问题。传统调试与日志工具往往难以应对这种实验性、多版本的情境。FlorDB引入了多版本后见日志(Multiversion Hindsight Logging),允许工程师使用最新版本的日志语句来查询过去的版本,即使旧版本记录了不同的数据。日志语句传播能够将日志语句一致地注入到过去的代码版本中,而不受代码库变动的影响。一旦日志语句在代码版本间传播,多版本后见日志中剩余的挑战是基于先前运行的检查点高效重放新的日志语句。最后,需要连贯的用户体验来帮助MLE跨所有代码与数据版本进行调试。为此,FlorDB提出了统一的关系模型以高效处理历史查询,提供日志历史的全面视图以简化对过去代码迭代的探索。我们在多种基准上进行了性能评估,证实了其可扩展性以及利用基于查询的过滤与基于检查点的并行化实现高效重放并提供实时查询响应的能力。

关键词

引用

@article{arxiv.2310.07898,
  title  = {Multiversion Hindsight Logging for Continuous Training},
  author = {Rolando Garcia and Anusha Dandamudi and Gabriel Matute and Lehan Wan and Joseph Gonzalez and Joseph M. Hellerstein and Koushik Sen},
  journal= {arXiv preprint arXiv:2310.07898},
  year   = {2024}
}