目标化交叉验证
机器学习
2022-02-21 v3 机器学习
摘要
在许多应用中,我们可以访问完整数据集,但仅对预测变量特定区域的预测感兴趣。一种标准方法是从一组候选方法中找到全局最优的建模方法。然而,现实中一种候选方法一致优于其他方法的情况或许很少见。针对此情景的一种自然方法是在性能评估中采用加权损失以反映区域特定的兴趣。我们提出一种目标化交叉验证(TCV),基于一般的加权损失来选择模型或过程。我们证明TCV在加权损失下选择最佳候选者是一致的。实验研究用于展示TCV的使用及其相对于全局CV或仅使用局部数据建模局部区域的潜在优势。先前对CV的研究依赖于这样一个条件:当样本量足够大时,两个候选者的排名保持不变。然而,在许多具有数据生成过程变化或高度自适应建模方法的应用中,方法的相对性能并非随样本量变化而静态不变。即使数据生成过程固定,两种方法的排名也可能无限次切换。在这项工作中,我们放宽了最佳候选者随样本量变化可切换的条件,从而拓宽了选择一致性的概念,并建立了TCV的一致性。这一灵活框架可应用于高维和复杂机器学习场景,其中建模过程的相对性能是动态的。
引用
@article{arxiv.2109.06949,
title = {Targeted Cross-Validation},
author = {Jiawei Zhang and Jie Ding and Yuhong Yang},
journal= {arXiv preprint arXiv:2109.06949},
year = {2022}
}