中文

空间预测中验证与部署的对齐:目标加权交叉验证

机器学习 2026-05-22 v3 机器学习

摘要

可靠的预测性能估计对于空间环境建模至关重要,其中机器学习模型用于从分布不均的观测数据生成地图。标准交叉验证(CV)假设验证数据在目标域内具有预测条件的代表性。在实践中,由于偏好性或聚类采样,这一假设常常被违背,导致有偏的性能和不确定性估计。我们引入了一种面向部署的验证框架,基于加权CV,使验证任务与指定域内预测任务的分布对齐。该框架包括重要性加权交叉验证(IWCV)和一种基于校准的方法——目标加权交叉验证(TWCV),其使用具有空间意义的任务描述符,如环境协变量和预测距离。模拟实验表明,在实际采样设计下,传统的非空间和空间CV策略可能表现出显著偏差,而加权CV方法在验证任务充分覆盖部署任务空间时大幅减少了这种偏差。德国NO₂浓度制图的一个案例研究表明,标准CV可能因采样偏差而高估预测误差,而加权CV得到的估计更符合部署条件。该框架将验证任务生成与风险估计分离,为样本分布与预测域不同的空间预测场景提供了改进性能评估的实用方法。

关键词

引用

@article{arxiv.2603.29981,
  title  = {Aligning Validation with Deployment in Spatial Prediction: Target-Weighted Cross-Validation},
  author = {Alexander Brenning and Thomas Suesse},
  journal= {arXiv preprint arXiv:2603.29981},
  year   = {2026}
}