机器学习模型的高性价比重训练
机器学习
2023-10-09 v1
摘要
随着数据随时间变化,重训练机器学习(ML)模型对于维持其性能十分重要。然而,这通常代价高昂,因为需要再次处理整个数据集。这在过于频繁重训练(导致不必要的计算成本)与重训练不够频繁(导致模型过时且不准确)之间造成了权衡。为应对这一挑战,我们提出了能够自动且高性价比地决策何时重训练ML模型的ML系统。我们旨在通过考虑与每个决策相关的成本来优化该权衡。我们的研究聚焦于基于数据、模型以及模型所回答的预测查询等各类因素,决定是否重训练或保留现有ML模型。我们的主要贡献是一个称为Cara的成本感知重训练算法,该算法在数据与查询流上优化上述权衡。为评估Cara的性能,我们分析了合成数据集,并证明Cara能够适应不同的数据漂移与重训练成本,同时表现与最优回溯算法相近。我们还使用真实世界数据集进行了实验,表明Cara在做出更少重训练决策的同时取得了优于漂移检测基线的准确率,最终降低了总成本。
引用
@article{arxiv.2310.04216,
title = {Cost-Effective Retraining of Machine Learning Models},
author = {Ananth Mahadevan and Michael Mathioudakis},
journal= {arXiv preprint arXiv:2310.04216},
year = {2023}
}