中文

改进协变量偏移下的重要性估计以提供准确的预测误差

机器学习 2024-02-05 v1 机器学习

摘要

在传统机器学习中,算法的预测基于训练数据集和测试数据集服从相同分布的假设。然而,在现实世界的数据中,这一条件并不成立,例如,协变量的分布发生变化,而目标变量的条件分布保持不变。这种情况被称为协变量偏移问题,此时标准误差估计可能不再准确。在此背景下,重要性是一种常用于减轻协变量偏移对误差估计影响的度量。其主要缺点是不易计算。Kullback-Leibler 重要性估计过程 (KLIEP) 能够以一种很有前景的方式估计重要性。尽管其性能良好,但由于它仅包含协变量信息来计算重要性,因此未能忽略目标信息。鉴于此,本文探讨了在重要性计算中考虑目标信息时潜在的性能提升。随后,对重要性进行了重新定义,以便以这种方式进行推广。除了潜在的性能提升外,纳入目标信息使得该方法能够应用于一项关于浮游生物分类的真实应用,该应用推动了本研究,并以其高维度为特征,因为考虑目标变量而非协变量可以减少计算量和协变量中的噪声。本文还探讨了当逻辑回归 (LR)、核均值匹配 (KMM)、集成核均值匹配 (EKMM) 以及 KLIEP 的朴素前身——核密度估计 (KDE) 方法估计重要性时,纳入目标信息的影响。实验结果表明,使用目标信息可以得到更准确的误差估计,特别是对于更有前景的 KLIEP 方法而言。

关键词

引用

@article{arxiv.2402.01450,
  title  = {Improving importance estimation in covariate shift for providing accurate prediction error},
  author = {Laura Fdez-Díaz and Sara González Tomillo and Elena Montañés and José Ramón Quevedo},
  journal= {arXiv preprint arXiv:2402.01450},
  year   = {2024}
}