中文

通过模型排序进行模型选择

机器学习 2024-09-17 v1 机器学习

摘要

我们提出了一种新颖的方法,用于选择数据的最佳模型。基于嵌套模型的排他性属性,我们发现包含风险最小化预测器的最简约模型。我们证明了对两个连续嵌套模型的最小经验风险差异,称为连续经验风险 excess (successive empirical excess risk, SEER),存在概率近似正确 (PAC) 界限。基于这些界限,我们提出了一种称为嵌套经验风险 (nested empirical risk, NER) 的模型阶数选择方法。通过对模型进行智能排序的排序 NER (S-NER) 方法,最小风险得以降低。我们构建了一个测试,用于预测扩大模型是否会降低最小风险。以高概率,NER 和 S-NER 分别选择真实模型阶数和包含风险最小化预测器的最简约模型。我们在线性回归中使用 S-NER 模型选择,并表明,在没有任何先验信息的情况下,S-NER 方法能够超过辅助真实模型阶数先验知识的正交匹配追踪 (orthogonal matching pursuit, OMP) 等特征排序算法的准确率。此外,在 UCR 数据集上,NER 方法显著降低了 UCR 数据集分类的复杂度,几乎不损失准确率。

关键词

引用

@article{arxiv.2409.09674,
  title  = {Model Selection Through Model Sorting},
  author = {Mohammad Ali Hajiani and Babak Seyfe},
  journal= {arXiv preprint arXiv:2409.09674},
  year   = {2024}
}

备注

55 pages, 4 figures, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence, October 26, 2023