利用测试数据重用的序贯算法修改
机器学习
2022-03-23 v1 机器学习
统计方法学
摘要
在机器学习算法的初始发布之后,可通过在随后收集的数据上重新训练、添加新发现的特征等方式对模型进行微调。每次修改都会引入性能退化的风险,必须在测试数据集上加以验证。为每个修改组装新数据集未必总是可行,尤其在多数修改为微小改动或快速连续实施时。近期工作已展示如何在同一数据集上重复测试修改,并通过(i)沿网格离散化测试结果和(ii)应用Bonferroni校正以调整自适应开发者所考虑修改总数来防止过拟合。然而,当多数修改为有益和/或高度相关时,标准Bonferroni校正过于保守。本工作研究使用alpha回收和序贯拒绝图程序(SRGPs)的更强有力方法。我们引入考虑自适应选择的算法修改之间相关性的新颖扩展。在实证分析中,SRGPs控制了批准不可接受修改的错误率,并比先前方法批准了数量显著更多的有益修改。
引用
@article{arxiv.2203.11377,
title = {Sequential algorithmic modification with test data reuse},
author = {Jean Feng and Gene Pennello and Nicholas Petrick and Berkman Sahiner and Romain Pirracchio and Alexej Gossmann},
journal= {arXiv preprint arXiv:2203.11377},
year = {2022}
}