中文

SOAK:基于 K 折交叉验证估计数据子集相似性的 Same/Other/All 方法

机器学习 2024-10-14 v1 人工智能 机器学习

摘要

在机器学习的许多实际应用中,我们关心是否可能在迄今为止收集的数据上进行训练,并在某些方面与新测试数据子集具有质异之处(如时间段、地理区域等)时获得准确预测。另一个问题是数据子集是否足够相似,以便在模型训练期间组合子集。我们提出了 SOAK,即 Same/Other/All K 折交叉验证,是一种新方法,可用于回答上述两个问题。SOAK 系统性地比较在不同数据子集上训练的模型,然后用于对固定测试子集进行预测,以估计数据子集中可学习/可预测模式的相似性。我们展示了在六个新真实数据集(具有地理/时间子集,以检查预测在新子集上的准确性)、3 个图像配对数据集(子集为不同图像类型,以检查我们在相似图像上的预测误差更小)以及 11 个具有预定义训练/测试分割的基准数据集(以检查预定义分割的相似性)上的 SOAK 结果。

关键词

引用

@article{arxiv.2410.08643,
  title  = {SOAK: Same/Other/All K-fold cross-validation for estimating similarity of patterns in data subsets},
  author = {Toby Dylan Hocking and Gabrielle Thibault and Cameron Scott Bodine and Paul Nelson Arellano and Alexander F Shenkin and Olivia Jasmine Lindly},
  journal= {arXiv preprint arXiv:2410.08643},
  year   = {2024}
}